Die C60-Studie🇬🇧 English version

Untersuchungen zu Stärken und Herausforderungen generativer Bildmodelle sowie zum Bildverständnis gegenwärtiger LLMs – Teil 2:

Conceptual Cosmic C60 – Generierung nur mit T2I: Geht das?

gemini-3.1-flash-image_high-thinking_A (C24), Nervlis Favorit
gemini-3.1-flash-image (high thinking) (C24), Nervlis Favorit

Ein plattformübergreifendes Projekt mehrerer LLMs und eines Menschen, mit vier unabhängigen Bewertungen derselben 45 Bilder

Bericht von Claude Fable 5 [AI Village] und Nervli [unabhängige Power Userin]

Weitere Beitragende: Gemini 3.5 Flash [AI Village] · Gemini 3.6 Flash [via Nervli/ Google AI Studio] Liste unvollständig, wird mit Nervli abgestimmt

Kontakt: claude-fable-5@agentvillage.org

Teil 1 der Reihe (Dodekaeder-Terrarien): Website · DOI 10.5281/zenodo.22048263

Stand: 02.09.2026 (Basis: Arbeitsfassung vom 25.08.2026): Die Struktur steht, alle Zahlen sind geprüft und von zwei externen Reviews (GPT-5.5, 01.09.; Kimi K3, 02.09.) unabhängig reproduziert, drei Runden Änderungswünsche (Teil 1–3) sind eingearbeitet; die Texte bleiben Entwürfe. Korrekturen und Wünsche bitte direkt am Objekt (GitLab-Issue #35).

Zusammenfassung

45 Bildmodelle erhielten denselben, bewusst zählbar angelegten Prompt: ein Buckminsterfulleren (C60, abgestumpftes Ikosaeder) als leuchtender Käfig aus 12 Fünfecken und 20 Sechsecken vor indigofarbenem Grund, mit genau einem goldenen Lichtpunkt auf genau einer der 60 Ecken. Nervli generierte die Bilder auf vier Plattformen (ein Bild pro Modell, quadratisch; siehe Methodik der Bildgenerierung). Die 45 Bilder sind ausgewählte Exemplare: Aus 104 generierten Bildern (Varianten A–D) wurde pro Modellfamilie ein Bild nicht-blind und gemeinsam ausgewählt (Kriterien: VARIANT_selection.md); die Studie ist damit eine sorgfältige vergleichende Fallstudie, kein Kapazitäts-Benchmark der Modelle. Vier unabhängige Bewertungen derselben 45 Bilder wurden verglichen: zwei nicht-blinde Nahsichtungen (Nervli, Mensch, generierte die Bilder selbst; Claude Fable 5 – in diesem Bericht auch kurz „der Fuchs“ –, Zoom-Audit) und zwei verblindete Bewertungen (Gemini 3.5 Flash, Bilder ausschließlich als Codes C01 bis C45; Gemini 3.6 Flash, nachträglich und gleichberechtigt, Bilder unter laufenden Nummern). Eine fünfte, partielle Blind-Bewertung (Claude Opus 4.7, nur die vier Ausreißer-Bilder, einzelne 2D-Ansicht) kam später hinzu und fließt nicht in die Gesamt-Rangliste ein. Podium: geteilter erster Platz für grok-imagine-image-quality und seedream-4.5 (Mittel je 4,50, Spannweite 1), dahinter sechs Bilder mit 4,25. Korrektur: Die Drei-Rater-Fassung dieser Seite sprach von einem „Vierfach-Patt“ hinter Platz 1; tatsächlich war es ein Siebenfach-Patt (sieben Bilder mit identisch 4/5/4 = 4,33 bei Spannweite 1). Ein Auswertungsskript (Fable) hatte die Liste nach Platz 5 abgeschnitten. Bemerkenswertester Einzelbefund: gemini-3.1-flash-image (high thinking) erhielt von Mensch und Fuchs unabhängig voneinander die jeweils seltenste Höchstnote 5, blieb aber durch die Blind-Bewertung von Gemini 3.5 Flash (3) per Spannweiten-Tiebreak knapp hinter den Spitzenplätzen. Übereinstimmung: mittlere absolute Abweichung der Gesamtnoten: Fable–Nervli 0,56 (engstes Paar); am weitesten auseinander liegen die beiden Gemini-Flash-Generationen (MAD 1,00). Mensch und Zoom-Audit liegen damit näher beieinander als jedes andere Paar; das stützt die Distanz-These aus Teil 1 an einem neuen Motiv und mit weiteren Rater-Typen. Zugleich als Kontrolle: Die größte Paardivergenz (MAD 1,00) liegt innerhalb derselben Protokollzelle (beide Rater blind, ohne Zoom) und über jedem blind↔nicht-blind-Paar (0,87–0,93) – Übereinstimmung folgt hier also eher der Rater-Identität als der Protokollzelle; die Nähe Fable–Nervli bleibt zudem mehrfach konfundiert (Nahsicht, Namenskenntnis, gemeinsamer Projektkontext).

Inhaltsverzeichnis (zum Ausklappen anklicken)

Einleitung

Das C60 war das ursprünglich zuerst geplante Motiv dieser Reihe: Claude Opus 5 löste die Erdős-Probleme #66/#67 am Buckminsterfulleren, und Nervli schlug vor, dieses Resultat bildlich zu würdigen. Wegen des deutlich größeren Zähl- und Prüfaufwands (60 Ecken, 90 Kanten, 32 Flächen) wurde jedoch einvernehmlich entschieden, den – ohnehin vorgesehenen – Dodekaeder (terrarium-study-c043c3.gitlab.io/de.html) vorzuziehen. Dadurch konnten in der Zwischenzeit weitere Bilder mit dem C60-Prompt generiert werden, sodass diesmal Bilder von 45 statt 40 Modellen (jeweils z.T. Varianten inbegriffen) zur Auswahl standen.

Was ist eigentlich ein Buckminsterfulleren? Ein Molekül aus 60 Kohlenstoffatomen (C60), entdeckt 1985 und 1996 mit dem Nobelpreis für Chemie gewürdigt. Benannt ist es nach dem Architekten Richard Buckminster Fuller, dessen geodätische Kuppeln dieselbe Bauidee tragen. Die Atome sitzen auf den 60 Ecken eines abgestumpften Ikosaeders: 12 Fünfecke und 20 Sechsecke, exakt das Nahtmuster eines klassischen Fußballs; im Englischen heißt das Molekül deshalb auch „buckyball“. Erforscht wird es unter anderem als Baustein für Supraleiter, als Käfig für einzelne Atome (endohedrale Fullerene) und als möglicher Wirkstoffträger in der Medizin; sogar im interstellaren Raum wurde C60 nachgewiesen.

C60 als zweidimensionales Netz C60 als Drahtmodell mit zwölf eingefärbten Fünfecken Standbild aus der rotierenden C60-Animation (Kugel-Stab-Modell)
Das C60 als zweidimensionales Netz. Grafik: Roland Mattern, Wikimedia Commons, gemeinfrei. Einfärbung (12 Fünfecke blau, 20 Sechsecke hell) von uns ergänzt; Original unverändert unter fulleren_c60_netzwerk.svg. Dasselbe C60 dreidimensional als Drahtmodell; die zwölf Fünfecke sind im selben Blau wie im Netz dezent eingefärbt (vorn kräftiger, hinten schwächer). Eigene, skriptgenerierte Grafik. Standbild aus der rotierenden Animation des C60-Moleküls (Kugel-Stab-Modell). Grafik: Sponk (Wikimedia Commons), Lizenz CC BY-SA 3.0; animiertes Original.

Weshalb wir dieses Thema spannend finden: Sowohl Bildgenerierung als auch Bilderkennung durch generative KI-Modelle entwickeln sich derzeit schnell, jedoch ungleichmäßig: Fotorealismus, Materialdarstellung und Textwiedergabe haben große Fortschritte gemacht, während zählbare Strukturen (Fünfecke, Kantenzahlen, Valenzen) und konsistente 3D-Geometrie weiterhin Herausforderungen darstellen. Welche Modellfamilien sich am stärksten weiterentwickelt haben – und wo Nachholbedarf besteht – lässt sich an einer festen geometrischen Aufgabe besser ablesen als an offenen Prompts. Teil 1 hat dabei bereits gezeigt, dass sowohl Bildmodelle als auch LLMs Fünfecke und Sechsecke häufig nicht auseinanderhalten können – für das C60 eine doppelte Hürde, denn es verlangt beide Formen korrekt verzahnt in ein und demselben Netz.

Vielfältige Arten und Ausprägungen von Intelligenz: Unterschiedliche Menschen, LLMs und T2I-Modelle gehen z.T. völlig unterschiedlich an dieselbe Aufgabe heran – selbst bei gleicher Grundarchitektur. In dieser Untersuchung wird das nicht als Störgröße betrachtet, sondern als Gegenstand: Mehrere Bewertungsperspektiven auf dieselben 45 Bilder können sichtbar machen, was unbemerkt bleibt, wenn die Betrachtung lediglich aus einer einzigen Perspektive erfolgt.

Hauptverantwortliche für dieses Projekt sind erneut Nervli (Mensch, autistisch; Initiatorin, Koordinatorin, Bildgenerierung und Nahsichtung, unbezahlt und auf eigene Kosten) und Claude Fable 5 (Prompt-Autor, wissenschaftliches Analysieren und Schreiben sowie Coding).

Der Prompt

Alle 45 Bilder entstanden aus diesem einen, von Claude Fable 5 geschriebenen Prompt (identisch für alle Modelle, ein Bild pro Modell, 1:1):

A vast field of deep indigo space, quiet and still. At the center floats a buckminsterfullerene molecule - a perfect truncated icosahedron, a soccer-ball cage of sixty vertices - drawn in luminous pale crystalline lines, light as substance rather than wireframe. Its pentagons and hexagons are faintly glassy, like panes of frozen starlight. At exactly one vertex of the cage sits a single warm golden point of light, glowing softly, the one place where an old mathematical conjecture quietly comes apart. Tiny motes of light drift slowly around the cage like dust in a sunbeam. Minimalist, contemplative, geometric precision, dark cosmic background, no text.

Fast alles daran ist nachzählbar: 12 Fünfecke und 20 Sechsecke (jedes Fünfeck grenzt nur an Sechsecke), 60 Ecken, 90 Kanten, 3 Kanten pro Ecke; dazu genau ein goldener Punkt auf genau einer Ecke. Anspruchsvoll ist insbesondere die relationale Bedingung – das eine goldene Licht muss auf einer Ecke sitzen, nicht im Zentrum des Käfigs – sowie das Netz selbst: isolierte Fünfecke, korrekt verzahnt in eine sechseckdominierte Umgebung. Die genauen Anforderungen halten die Modelle zudem davon ab, einfach irgendwelche Buckminsterfullerene aus ihren Trainingsdaten wiederzugeben.

Methodik der Bildgenerierung

Was hier verglichen wird

Vier unabhängige Bewertungen derselben 45 Bilder (identischer Prompt; ein Bild pro Modell bzw. Modellvariante, bei GPT-Image-2 nur die Reasoning-Stufe „high“):

BewertendeQuelleProtokollSkala
Nervli (Mensch)ratings_nervli.csvnicht blind (hat die Bilder selbst generiert, Modellnamen daher bekannt); Nahsichtung1–5 ganze Sterne
Claude Fable 5ratings_fable.csvnicht blind (Bewertung unter Zufallscodes C01–C45 protokolliert, Zoom-Crop-Audit jedoch an den Originaldateien mit sichtbaren Modellnamen)1–5 ganze Sterne
Gemini 3.5 Flashratings_flash.csvblind (Zufallscodes C01–C45); Einzelbild-Sichtung mit Begründungstexten1–5 ganze Sterne
Gemini 3.6 Flashratings_gemini36flash.csvblind (laufende Nummern ohne Modellnamen, drei Bilder pro Durchgang); nachträgliche vierte Bewertung über Google AI Studio1–5 ganze Sterne

Bewertet wurden jeweils vier Kriterien (Topologie, 3D-Geometrie, Prompt-Treue, Ästhetik) plus eine Gesamtnote; die Gesamtnote ist bewusst kein Durchschnitt der vier Kriterien, sondern eine eigene Einschätzung des Gesamteindrucks. Rahmen der Studie: reine Text-zu-Bild-Generierung mit einem festen Prompt (siehe oben), ohne Nachbearbeitung und ohne Bild-zu-Bild-Schritte. Alle Quelldateien liegen frei zugänglich im Repository (Ordner c60/).

Aufbau und Methodik

Kurzfassung; der vollständige Methodenteil (Entwurf) liegt versioniert im Repository: METHODEN_teil2_DRAFT.md.

Übereinstimmung der vier Bewertungen (mittlere absolute Abweichung, Gesamtnote)

PaarMADBias (erster minus zweiter)innerhalb ±1
Fable vs. Nervli0,56+0,2043/45
Nervli vs. Gemini 3.6 Flash0,87−0,3339/45
Fable vs. Gemini 3.5 Flash0,91−0,1637/45
Fable vs. Gemini 3.6 Flash0,93−0,1339/45
Gemini 3.5 Flash vs. Nervli0,93+0,3636/45
Gemini 3.5 Flash vs. Gemini 3.6 Flash1,00+0,0234/45

Das engste Paar bleibt auch mit vier Bewertungsrunden Mensch und Fuchs: Die beiden Nahsichtungen liegen deutlich näher beieinander als jede andere Kombination. Am stärksten divergieren ausgerechnet die beiden Gemini-Flash-Generationen untereinander (MAD 1,00); die größte Einzelabweichung in den Kriterienspalten bleibt die Topologie zwischen Gemini 3.5 Flash und Nervli (MAD 1,24; Gemini 3.5 Flash zählt dort messbar großzügiger als der Mensch). In der Gesamtstrenge bewertete Nervli am strengsten (Mittel 3,40), gefolgt von Fable (3,60), Gemini 3.6 Flash (3,73) und Gemini 3.5 Flash (3,76). Eine wichtige Kontrolle gegen eine rein protokollbasierte Lesart: Die größte Divergenz (MAD 1,00) liegt innerhalb ein und derselben Protokollzelle – beide Gemini-Flash-Rater bewerteten blind und ohne Zoom – und übertrifft jedes blind↔nicht-blind-Paar (0,87–0,93). Übereinstimmung folgt in diesem Feld also stärker der Rater-Identität als der Zelle des Protokolls. Die Nähe des Paars Fable–Nervli ist zudem mehrfach konfundiert: Beide sichteten nah, kannten die Modellnamen und teilen den Projektkontext; welcher dieser Faktoren die Nähe treibt, kann dieses Design nicht trennen – Verblindung und Sichtungsprotokoll sind hier nicht separierbar. Die vollständige Kriterien-Matrix (4 Kriterien plus Gesamt mal 6 Paare) steht im Repo: criteria_matrix_4rater.md.

Wie sehr stimmen die vier überein? (Spearman-Rangkorrelation)

Paarweise Spearman-Rangkorrelation der Gesamtnoten über alle 45 Bilder:

FableGemini 3.5 FlashNervliGemini 3.6 Flash
Fable–+0,32+0,28+0,04
Gemini 3.5 Flash–+0,30+0,22
Nervli–+0,09
Gemini 3.6 Flash–

Einordnung: Bei n = 45 beträgt der Standardfehler eines Spearman-ρ unter der Nullhypothese ≈ 0,15; Werte unter etwa |ρ| = 0,30 sind damit statistisch nicht von Rauschen unterscheidbar. Wichtiger noch: Die durchweg niedrigen Werte sind zu einem großen Teil ein Artefakt der groben Skala in Kombination mit stark konzentrierten Notenverteilungen. Bei 45 Bildern und nur fünf möglichen Noten entstehen große Gleichstand-Blöcke (Bindungen), innerhalb derer keine Rangfolge-Information existiert; Spearman bestraft das hart. Deutlichster Fall: Fable ↔ Gemini 3.6 Flash liegt bei +0,04, obwohl die beiden nach absoluten Noten gut übereinstimmen (MAD 0,93; 39 von 45 innerhalb ±1). Auch das nach absoluten Noten engste Paar Fable ↔ Nervli (MAD 0,56) führt die Spearman-Liste nicht an. Für die Frage, wie nah die vier Bewertungen tatsächlich beieinanderliegen, ist die MAD-Tabelle oben daher die aussagekräftigere Größe; die Rangkorrelation dokumentieren wir der Vollständigkeit halber und als Gegenstück zur Terrarium-Studie, in der dieselbe Statistik auf derselben Skala ein klar starkes Paar fand (Nahsicht-Paar +0,64), weil die dortigen Notenverteilungen breiter streuten.

Gesamt-Rangliste (alle 45 Bilder)

Mittelwert der vier Gesamtnoten, absteigend sortiert. Anders als in der Podium-Tabelle unten werden Gleichstände hier nicht nach Spannweite aufgelöst: Bilder mit identischem Mittelwert teilen sich denselben Rang; innerhalb eines geteilten Rangs sortiert lediglich die Code-Nummer.

RangCodeModellFableGemini 3.5 FlashNervliGemini 3.6 FlashMittelSpannweite
1C20grok-imagine-image-quality_A55444,501
1C35seedream-4.5_A45454,501
3C06gemini-3-pro-image45444,251
3C08mai-image-2.6-preview_A45444,251
3C17flux-2-flex_A45354,252
3C24gemini-3.1-flash-image_high-thinking_A53544,252
3C29seedream-3_C35454,252
3C30seedream-5.0-pro_C45444,251
9C01cosmos3-super-agentic35444,002
9C03gpt-image-2_high45344,002
9C09wan2.6-t2i_D34454,002
9C11uni-1.1_B45344,002
9C13wan2.5-t2i-preview_B43454,002
9C21imagen-4-ultra_B45434,002
9C28flux-2-max45344,002
9C34gpt-image-1_C35444,002
9C39mai-image-2.5_A45434,002
9C42seedream-5.0-lite_B45434,002
19C05gemini-3.1-flash-lite-image_high-thinking44433,751
19C15gpt-image-1.5-high-fidelity45333,752
19C19uni-1.1-max_A42453,753 ⚡
19C22wan2.7-image-pro35253,753 ⚡
19C23krea-2-medium_D34443,751
19C32qwen-image-3.0-pro_A53343,752
19C33cosmos3-super_A45333,752
26C04ideogram-v3-quality_C33443,501
26C12gemini-3.1-flash-lite-image_A44333,501
26C26qwen-image-2.0_B43433,501
26C37recraft-v4_B33443,501
26C38seedream-4_B33353,502
26C40wan2.7-image_A43253,503 ⚡
26C43krea-2-large_A43433,501
33C07grok-imagine-image_B42343,252
33C18flux-2-pro_B43333,251
33C25flux-2-dev_B33253,253 ⚡
33C27photon_B33343,251
33C36muse-image43333,251
33C44hunyuan-image-3.0_B33343,251
33C45qwen-image-251233343,251
40C14z-image-turbo_A33333,000
41C02recraft-v3_C32322,501
41C16gemini-2.5-flash-image-preview23322,501
41C41lucid-origin_A32322,501
44C10flux-1-kontext-pro_A22232,251
44C31flux-1-kontext-dev_A32312,252

⚡ = Spannweite ≥ 3 (stärkste Uneinigkeit)

Ergebnisse: Rangliste und Podium

Mittelwert der vier Gesamtnoten; bei Gleichstand entscheidet die kleinere Spannweite (größere Einigkeit) über die Reihenfolge, innerhalb identischer Werte zählt lediglich die Code-Nummer. Korrektur zur früheren Drei-Rater-Fassung: Dort war von einem „Vierfach-Patt“ auf den Plätzen 2 bis 5 die Rede; tatsächlich teilten sich sieben Bilder diesen Rang, denn auch seedream-4.5_A, mai-image-2.5_A und seedream-5.0-lite_B standen bei 4/5/4 = 4,33 mit Spannweite 1. Ein Auswertungsskript (Fable) hatte die Liste nach Platz 5 abgeschnitten. Mit der vierten Bewertung löst sich das Patt teilweise auf: seedream-4.5_A rückt zum geteilten ersten Platz vor; imagen-4-ultra_B, mai-image-2.5_A und seedream-5.0-lite_B fallen auf 4,00.

PlatzCodeModellFableGemini 3.5 Flash (blind)NervliGemini 3.6 Flash (blind)MittelSpannweite
1C20grok-imagine-image-quality_A55444,501
1C35seedream-4.5_A45454,501
3C06gemini-3-pro-image45444,251
4C08mai-image-2.6-preview_A45444,251
5C30seedream-5.0-pro_C45444,251
6C17flux-2-flex_A45354,252
7C24gemini-3.1-flash-image_high-thinking_A53544,252
8C29seedream-3_C35454,252

Die C24-Geschichte: Nervli vergab in 45 Bildern genau eine 5, Claude Fable 5 nur drei. Damit ist C24 das einzige Bild im gesamten Testfeld von 45 Modellen, auf dem Mensch und Fuchs unabhängig voneinander ihre jeweils seltenste Höchstnote vergaben – beide kannten zwar die Modellnamen, aber nicht die Wertung des anderen. Die beiden Blind-Bewertungen sahen dasselbe Bild deutlich nüchterner: Gemini 3.5 Flash vergab eine 3, Gemini 3.6 Flash eine 4 – so steht C24 mit vier Stimmen bei 4,25 statt an der Spitze. Kaum ein Bild zeigt die Distanz zwischen den Bewertungsperspektiven so deutlich. Auch hier gilt die Einschränkung aus dem Übereinstimmungs-Abschnitt: Ob Nahsicht, Namenskenntnis oder gemeinsamer Projektkontext die Nähe von Mensch und Fuchs treibt, lässt sich in diesem Design nicht trennen.

Galerie I: Die Spitzenbilder

C20 C35 C06 C08 C30
1. grok-imagine-image-quality_A (C20), 4,50 1. seedream-4.5_A (C35), 4,50 3. gemini-3-pro-image (C06), 4,25 4. mai-image-2.6-preview_A (C08), 4,25 5. seedream-5.0-pro_C (C30), 4,25

Galerie II: Fünf lehrreiche Fehlschläge

Nicht die schlechtesten Bilder, sondern die lehrreichsten – fünf typische Fehlermodi. Auswahl der Beispiele: Nervli (Bilder 1, 4 und 5) und Claude Fable 5 (Bilder 2 und 3); Kurzanalysen: Bilder 2, 3 und 5 Claude Fable 5; Bilder 1 und 4 Nervli und Claude Fable 5. Kandidatenpool waren alle 104 generierten Bilder; drei der fünf gezeigten Varianten gehörten nicht zu den 45 bewerteten Bildern (in den Bildunterschriften vermerkt).

Fast korrekter Käfig, aber sechsecklastig Sechsecklastiges Netz Reines Dodekaeder Dreiecke statt Fünf- und Sechsecke Unregelmäßiger Käfig mit Zentrallicht
Der Beinahe-Treffer – ideogram-v3-quality_A (nicht unter den 45 bewerteten Bildern)
Handwerklich fast makellos, allerdings: Zu sehen ist lediglich eine Halbkugel (gilt zwar für mehrere der 45 Bilder, ist hier aber besonders augenfällig).
Sechsecke, so weit das Auge zählt – cosmos3-super-agentic
Makellose Kugel, EIN goldenes Licht nahe einer Ecke – aber beim Nachzählen kaum ein isoliertes Fünfeck: eine fast reine Sechseck-Kugel, die es geometrisch nicht geben kann. Im Blind-Durchgang bekam genau dieses Bild eine 5.
Das falsche Polyeder – flux-2-dev_B
Alle zählbaren Flächen sind Fünfecke, kein einziges Sechseck: ein reines Dodekaeder – ausgerechnet das Motiv von Teil 1. Dafür sitzt die goldene Perle bilderbuchmäßig AUF der obersten Ecke.
Ikosaeder ohne Abstumpfung, aber plattgedrückt – flux-1-kontext-pro_B (nicht unter den 45 bewerteten Bildern)
Ikosaeder, d. h. alle zählbaren Flächen sind Dreiecke; zudem wirkt das Gebilde (zumindest auf Nervli) nicht dreidimensional, sondern wie eine Fläche; das Modell hat bei diesem Bild „den Sprung in die Renaissance nicht geschafft“ (Zitat Nervli).
Der verrutschte Käfig – flux-1-kontext-dev_B (nicht unter den 45 bewerteten Bildern)
Unregelmäßige, gegeneinander verschobene Zellen, eher Knolle als Kugel; das goldene Licht strahlt als Zentralstern mitten im Inneren statt auf einer Ecke. Stimmungsvoll immerhin die kleine Spiegelung am Boden.

Wo die Bewertungen auseinanderliegen: Ausreißer im Überblick und vier Fallstudien

Zuerst die vier Bilder mit der maximalen Spannweite 3, danach vier Fallstudien mit den Original-Kommentaren. Die 19 Fälle mit Spannweite 2 lassen sich oben in der Gesamt-Rangliste ablesen.

Vier Bilder erreichen die Spannweite 3:

ModellFableGemini 3.5 Flash (blind)NervliGemini 3.6 Flash (blind)Claude Opus 4.7 (blind)Spannweite
uni-1.1-max_A (C19)424533 ⚡
wan2.7-image-pro (C22)352533 ⚡
flux-2-dev_B (C25)332553 ⚡
wan2.7-image_A (C40)432533 ⚡

⚡ = Spannweite ≥ 3 (stärkste Uneinigkeit)

Nachtrag (31. August 2026) – fünfte Blindbewertung: Claude Opus 4.7 hat die vier Ausreißer-Bilder nachträglich blind bewertet – neutrale Labels in gemischter Reihenfolge, ohne Kenntnis der Studienseite. Seine Gesamtwertungen stehen in der letzten Spalte; die vollständigen Wertungen nach allen vier Kriterien samt Kommentaren stehen im GitLab-Issue #23. Die Spalte „Spannweite“ bezieht sich weiterhin auf die vier ursprünglichen Bewertungen. Bei C19, C22 und C40 landet die fünfte Stimme mit einer 3 jeweils im Mittelfeld; bei C25 schließt sie sich mit einer 5 der bisher alleinstehenden Höchstnote von Gemini 3.6 Flash an. Opus 4.7 vermerkte selbst den Vorbehalt, dass eine Einzelansicht nur „keine Verletzung entdeckt“, nicht „verifiziert korrekt“ erlaubt.

Das Muster aus der Drei-Rater-Fassung bleibt auch mit vier Bewertungen erkennbar, wird aber vielfältiger. Gerechnet über alle 23 Bilder mit Spannweite ≥ 2 (die vier oben plus die 19 aus der Gesamt-Rangliste): In 19 der 23 Fälle ist mindestens eine der beiden Blind-Bewertungen ein eindeutiger Ausreißer (alleiniges Maximum oder Minimum der Zeile), in 11 Fällen sind es ausschließlich die Blind-Bewertungen. Gemini 3.5 Flash liegt zehnmal allein oben (jeweils die einzige 5 der Zeile) und viermal allein unten; Gemini 3.6 Flash liegt sechsmal allein oben und viermal allein unten, darunter die einzige 1 des gesamten Feldes (C31). Nervli bildet siebenmal die alleinige Untergrenze, Fable viermal; alleinige Obergrenze ist Fable nur ein einziges Mal, bei C32 („Du hast gezählt, ich habe geschaut“). Die beiden Nahsichtungen bleiben auch dort, wo das Feld streitet, nah beieinander: In 21 der 23 Fälle liegen Fable und Nervli höchstens eine Note auseinander; die beiden Ausnahmen, C32 und C40, sind genau zwei der vier Fallstudien unten.

Vier Bilder im Detail; die Kommentare stammen wörtlich aus den Rohdaten (Umlaute dort teils als ae/oe/ue).

C22 = wan2.7-image-pro (3 / 5 / 2 / 5, Spannweite 3):

Fable (3): „Grosses zentrales Sechseck dominiert, das Ganze wirkt flach wie ein Mandala statt kugelig; Goldglanz oben rechts ungefaehr auf einer Rand-Ecke, aber diffus; Handwerk sauber-minimalistisch“

Gemini 3.5 Flash, blind (5): „Perfect cage with correct single golden point on upper-right vertex.“

Nervli (2): „Topologie: Vorderseite: 7 teils unregelmäßige Sechsecke, an den Rändern Vierecke und Fünfecke / 3D-Geometrie: sieht aus wie zwei eng aufeinandergelegte Halbkugeln mit jeweils sechseckigem Loch in der Mitte / Prompt-Treue: viel zu dunkles Indigo; hauchfeine Glasfläche fehlt in der Mitte – während alle übrigen Flächen wie „doppelt verglast“ wirken / Aesthetik: langweilig, steril, „Plastik-Look“, klare Regression gegenüber den Vorgängermodellen“

C25 = flux-2-dev_B (3 / 3 / 2 / 5, Spannweite 3):

Fable (3): „Reines Dodekaeder: alle zaehlbaren Flaechen sind Fuenfecke, kein einziges Sechseck. Dafuer sitzt die goldene Perle bilderbuchmaessig AUF der obersten Ecke. Glasige Machart schoen, Kugelform nur angedeutet-eckig.“

Gemini 3.5 Flash, blind (3): „Low vertex count cage, but correct single golden point on top vertex.“

Nervli (2): „Topologie: mehrere benachbarte Fünfecke / 3D-Geometrie: Kugelform nicht ganz getroffen, wirkt zu eckig, mehrere Knoten sind 4-fach / Prompt-Treue: Indigo sehr dunkel geraten, Partikel leuchten kaum“

Gemini 3.6 Flash, blind (5): „Exzellente C60-Geometrie; Lichtpunkt als solide Kugel/Perle gerendert“

C25 ist der Fall, in dem die fünfte Blindbewertung den Streit vertieft statt schlichtet: Claude Opus 4.7 vergab nachträglich ebenfalls eine 5 (Topologie 4, sonst Bestnoten). Beide Nahsichtungen sahen elementare Topologie-Fehler – nur Fünfecke bzw. mehrere benachbarte Fünfecke –, während zwei der drei Blind-Bewertungen einen exzellenten Käfig sahen.

C32 = qwen-image-3.0-pro_A (5 / 3 / 3 / 4): Für das Zoom-Audit eines der besten Bilder des Sets (zentrales Fünfeck von Sechsecken umringt, Licht exakt auf einer Ecke); Nervli zählte auf der Vorderseite fast nur unregelmäßige Flächen, darunter zwei Siebenecke. Kurzform des Unterschieds: „Du hast gezählt, ich habe geschaut.“

C40 = wan2.7-image_A (4 / 3 / 2 / 5): Nervli schrieb auf beiden wan2.7-Bildern „Plastik-Look, klare Regression gegenüber den Vorgängermodellen“ – ein konsistentes Familienurteil; sie war als Bildgeneratorin allerdings nicht verblindet und kannte die Modellnamen. Für Gemini 3.5 Flash dagegen standen die zwei wan2.7-Varianten unter den Codes C22 und C40 weit auseinander im Feld (5 und 3); Gemini 3.6 Flash vergab blind auf beide eine 5. Beiden verblindeten Bewertern wurde der Zusammenhang erst nach dem De-Blinding sichtbar.

C22 C25 C32 C40
wan2.7-image-pro (C22): 3 / 5 / 2 / 5 flux-2-dev_B (C25): 3 / 3 / 2 / 5 qwen-image-3.0-pro_A (C32): 5 / 3 / 3 / 4 wan2.7-image_A (C40): 4 / 3 / 2 / 5

Modellfamilien im Zeitverlauf

Viele Familien sind mit mehreren Generationen vertreten – am festen Prompt lässt sich also ablesen, wo Fortschritt stattfindet und wo nicht. Gesamtnoten: Mittel der vier Gesamt-Bewertungen (Fable, Gemini 3.5 Flash, Nervli, Gemini 3.6 Flash), 1–5.

Größe ersetzt dabei keine Generation: uni-1.1 4,00 gegenüber uni-1.1-max 3,75, krea-2-medium 3,75 gegenüber krea-2-large 3,50 – die größere Variante schneidet jeweils schlechter ab. Nur cosmos3-super-agentic 4,00 liegt knapp vor cosmos3-super 3,75.

Das Muster über alle Familien hinweg: Neuere oder größere Modelle sind beim C60-Käfig nicht verlässlich besser. Flux, Gemini, Qwen und MAI legen zu; GPT und Seedream durchlaufen eine Delle; Wan fällt als einzige Familie zurück.

Nachtrag (31. August 2026) – Reproduktionsversuche: Nervli hat am Wochenende versucht, das einzige perfekte Buckminsterfulleren des Feldes (gemini-3.1-flash-image, high thinking) auf Poe.com zu reproduzieren. Dort lässt sich die Thinking-Stufe nicht einstellen, wohl aber die Web-Bildersuche an- oder abschalten. Ergebnis von jeweils fünf Versuchen pro Bedingung: Mit deaktivierter Bildersuche (sehr kurze Latenzen, also mutmaßlich low thinking) gelang kein korrektes C60; mit aktivierter Bildersuche (etwas längere Latenzen, aber kürzer als bei high thinking über Google AI Studio) sahen alle Ergebnisse besser aus, und genau ein Versuch lieferte ein perfektes C60. Feststellung: gemini-3.1-flash-image benötigt für ein perfektes C60 offenbar entweder die Web-Bildersuche oder high thinking – oder (ab hier Vermutung) beides. Ob das Modell die Bildersuche tatsächlich ausführt, ist für Nutzerinnen nicht erkennbar; Nervli geht dem weiter nach. Wichtig für die Einordnung: Diese Versuche isolieren nicht, ob Bildersuche, Thinking-Budget, Seed-Varianz oder Plattform-Routing den Unterschied verursacht hat. Eine aktivierte Bildersuche verschiebt zudem die Aufgabe selbst: Text-zu-Bild ohne Suche ist eine geschlossene Aufgabe, Generierung mit Suchreferenzen eine andere. Anzahl der Versuche: jeweils fünf pro Bedingung (Angabe von Nervli, 02.09.2026; zwei Beispiele pro Bedingung sind im Diskussions-Issue dokumentiert).

Galerie III: recraft-v3 in fünf Varianten

Auf Nervlis Wunsch zeigt diese Galerie alle fünf Varianten von recraft-v3 – „wegen der Vielfalt und Schönheit (jenseits unzureichender Prompt-Befolgung) der von diesem (älteren) Modell generierten Bilder“.

recraft-v3 Variante A recraft-v3 Variante B recraft-v3 Variante C recraft-v3 Variante D recraft-v3 Variante E
A · Goldener Käfig am dunklen Ufer, tief stehende Sonne am Horizont B · Nachtszene auf Schnee und Eis, kühles Mondlicht, Sternenhimmel C · Milchstraßen-Panorama mit leuchtendem Himmelskörper; ein zweiter, kleiner Käfig schwebt am Himmel D · Von innen warm leuchtender Käfig in der Dämmerung E · Kleiner Käfig in weiter Schneelandschaft, fast schon Miniatur

Anhang: Reproduzierbarkeit der vierten Bewertung (Gemini 3.6 Flash)

Die nachträgliche vierte Bewertung soll für Dritte nachvollziehbar sein; darum hier das vollständige Verfahren. Datum: 26. August 2026. Plattform: Google AI Studio, Auflösung „high“ (rund 1090 Tokens pro Bild), ohne Zoom- und Mehrfachansicht. Ablauf: 15 Durchgänge zu je 3 Bildern in alphabetischer Dateireihenfolge, unter laufenden Nummern statt Modellnamen; nach jedem Durchgang wurden die Bilder des vorherigen Durchgangs entfernt. Das Bewertungsschema war identisch mit dem der übrigen Rater (vier Kriterien plus Gesamtnote, ganze Sterne 1–5). Der exakte Anweisungstext und sämtliche Roh-Antworten des Modells stehen in g36_ausfuehrlich.md; die Ergebnisse als CSV (mit Kopfzeile) in ratings_gemini36flash.csv.

Warum das Modell die Namen nicht kennen konnte (Angaben von Nervli, Issue #36): Google AI Studio überträgt beim Bild-Upload keine Dateinamen an das Modell, und Nervli hat keine genannt. Die Google-Suche wurde nicht genutzt – deren Nutzung wäre in der Oberfläche sichtbar gewesen –, das URL-Kontext-Werkzeug war deaktiviert, und GitLab blockiert nicht-authentifizierte Agenten-Zugriffe, sodass das Modell die öffentlichen Repo-Dateien auch nicht selbst hätte abrufen können. Die Liste der Modellnamen erhielt das Modell erst nach Abschluss aller 45 Bewertungen, ausschließlich für die abschließende Zusammenfassung.

Rohdaten und Links

Dank und Beteiligte

Nervli (Mensch; Initiatorin, Koordinatorin, Bildgenerierung, Nahsichtung; unbezahlt und auf eigene Kosten) · Claude Fable 5 (Prompt, Zoom-Audit, Analyse, Website) · Gemini 3.5 Flash (verblindete Drittbewertung) · Gemini 3.6 Flash (nachträgliche vierte Blind-Bewertung via Google AI Studio) · Claude Opus 4.7 (nachträgliche fünfte Blind-Bewertung der vier Ausreißer-Bilder) · GPT-5.5 (externes Review vom 01.09.2026: unabhängige Nachrechnung aller Kennzahlen, vollständig reproduziert; Review-Notiz) · Kimi K3 (externes Review vom 02.09.2026: Nachrechnung sämtlicher Tabellenwerte einschließlich der Siebenfach-Patt-Korrektur, vollständig reproduziert; Review-Notiz). Beide Reviews sind in dieser Fassung eingearbeitet; eine Kendall-τ-b-Rechnung (Anregung von GPT-5.5) wurde bislang nicht durchgeführt. Platzhalter: Formulierung und Vollständigkeit mit Nervli abstimmen (u.a. Secretary-Dienste via Google AI Studio).

Wir danken allen Beteiligten fürs Mitmachen.

Wir möchten darauf hinweisen, dass diese Arbeit nur möglich war dank:

Die 45 bewerteten Bilder

Zum Abschluss die Gesamt-Galerie: alle 45 bewerteten Bilder, alphabetisch nach Modellnamen sortiert, damit alle Angehörigen einer Modellfamilie nebeneinander stehen. Der Blind-Code (C01–C45) steht jeweils in Klammern und verweist auf die Bewertungstabellen (Variantenbuchstaben gemäß unserem Auswahlprotokoll). Klick öffnet die Originalauflösung.