Du erzeugst den perfekten Charakter. Beim zweiten Bild sieht er ähnlich aus. Beim dritten ist es ein entfernter Cousin. Beim fünften ein Fremder mit ähnlicher Jacke. Diese Drift ist das Problem, das am meisten blockiert, wer mit KI Comics, Kinderbücher, Markenmaskottchen, Post-Serien oder Storyboards erstellen will.
Die Ursache ist einfach und lohnt sich, vor jeder Technik zu verstehen: Bildmodelle haben kein Gedächtnis. Jede Erzeugung beginnt bei Null, ausgehend von zufälligem Rauschen, nur geleitet von dem, was du in diesem Moment geschrieben hast. Das Modell weiß nicht, was es vor zwei Minuten getan hat. Konsistenz ist also nichts, was die KI tut — es ist etwas, das du erzwingst.
Die gute Nachricht: Es gibt vier konkrete Methoden, das zu erzwingen, und der Abstand zwischen ihnen ist im Laufe von 2026 stark geschrumpft. Was früher ein eigenes Modelltraining erforderte, löst sich heute meist mit einem Referenzbild und Schreibdisziplin. Dieser Guide deckt alle vier ab, wann man welche nutzt und den praktischen Ablauf, der funktioniert.
Warum der Charakter zwischen einem Bild und dem nächsten "verschwindet"
Jede Erzeugung ist unabhängig. Selbst mit identischem Prompt erzeugen kleine Variationen im Prozess unterschiedliche Gesichter — und Gesichter sind genau der Bereich, in dem das menschliche Auge Unterschiede am präzisesten erkennt. Einen leicht anderen Stuhl akzeptierst du, ohne es zu bemerken; eine zwei Millimeter breitere Nase fällt dir sofort auf.
Das bedeutet, Textbeschreibung allein hat eine Grenze. Keine Wortmenge beschreibt ein Gesicht präzise genug, um es exakt zu reproduzieren. "Rote Haare, grüne Augen, Sommersprossen" grenzt eine große Menge möglicher Gesichter ein, und die KI wählt jedes Mal ein anderes.
Von hier aus teilen sich die Methoden in zwei Gruppen: solche, die die Beschreibung verbessern, und solche, die dem Modell ein Bild zum Kopieren geben. Erstere sind schnell und ungenau; letztere sind präzise und erfordern Vorbereitung.
💡 Goldene Regel: Konsistenz des allgemeinen Aussehens löst sich mit Text. Gesichtskonsistenz erfordert ein Referenzbild. Hat dein Projekt Nahaufnahmen, brauchst du eine Referenz.
Die vier Methoden im Vergleich
| Methode | Aufwand | Genauigkeit | Am besten für |
|---|---|---|---|
| Charakterbibel (nur Text) | Sehr niedrig | Mittel | Weite Einstellungen, stilisierte Illustration, wenige Assets |
| Referenzbild | Niedrig | Hoch | Die meisten Projekte: Posts, Kampagnen, Comics |
| Turnaround-Blatt | Mittel | Sehr hoch | Lange Serien, Comics, Bilderbuch |
| Modelltraining (LoRA) | Hoch | Maximal | Hunderte Bilder, Charakter für Jahre |
Ein wichtiges Detail des aktuellen Stands: Der Unterschied zwischen Referenz und Training ist deutlich geschrumpft. Für Marketing, soziale Netzwerke und übliche kommerzielle Inhalte liefert ein gut aufgebautes Referenzsystem Produktionsergebnisse ohne den Trainingsaufwand. Training lohnt sich weiterhin bei sehr großem Volumen oder wenn absolute Genauigkeit nötig ist.
Methode 1: die Charakterbibel
Das ist die Grundlage aller anderen Methoden, und der Schritt, den die meisten überspringen. Eine Charakterbibel ist ein fester Textblock, der alles beschreibt, was sich nicht ändern darf — und den du Wort für Wort in jeden Prompt einfügst.
Was aufnehmen
Nur was dauerhaft und sichtbar ist: geschätztes Alter, Gesichtsform, Haarfarbe und -schnitt, Augenfarbe, Hautton, markantes Merkmal, charakteristische Kleidung und ein einzigartiges Accessoire. Das Accessoire wird am meisten unterschätzt — eine Narbe, eine runde Brille, ein roter Schal oder eine Tätowierung funktionieren als visueller Anker und helfen dem Betrachter, den Charakter zu erkennen, selbst wenn das Gesicht leicht variiert.
Was weglassen
Alles, was sich von Szene zu Szene ändert: Pose, Ausdruck, Schauplatz, Beleuchtung, Winkel. Mischst du das in die Bibel, landest du bei lauter identischen Bildern — dem gegenteiligen Problem.
Eine fertige Vorlage
Beachte, dass nichts darüber steht, wo sie ist oder was sie tut. Dieser Block kommt unverändert in jeden Prompt, die Szene folgt danach:
Der Fehler, der die Methode zerstört
Mit Synonymen umschreiben. "Braune Lederjacke" und "karamellfarbener Ledermantel" erzeugen unterschiedliche Kleidungsstücke. Die Stabilität der Sprache trägt die Stabilität des Bildes: kopieren und einfügen, nicht umschreiben.
Methode 2: Referenzbild
Das ist die heute am meisten genutzte Methode und das beste Preis-Leistungs-Verhältnis. Du sendest ein Bild des Charakters, und das Modell extrahiert die visuellen Merkmale, um sie in neuen Szenen zu reproduzieren.
Wie man das Ankerbild wählt
Nicht jedes Bild eignet sich. Der ideale Anker hat ein großes, scharfes Gesicht, frontale oder leicht seitliche Beleuchtung ohne harte Schatten, neutralen Ausdruck und einfachen Hintergrund. Eine dramatische Nahaufnahme mit halbem Gesicht im Schatten ist eine miserable Referenz, egal wie schön sie ist: Die Hälfte der Information, die das Modell braucht, ist nicht sichtbar.
Ein oder mehrere Bilder
Eine Referenz funktioniert. Zwei oder drei, die verschiedene Winkel zeigen, funktionieren deutlich besser — der Unterschied zeigt sich vor allem, wenn du Posen oder Winkel verlangst, die in der ursprünglichen Referenz nicht existieren. Akzeptiert das Tool mehrere Eingaben, nutze das.
Wie man den Prompt mit Referenz schreibt
Die funktionierende Struktur ist immer dieselbe: festlegen, was sich nicht ändert, nur beschreiben, was sich ändert.
Der Satz "exakt gleich behalten" leistet mehr, als es scheint. Ohne ihn interpretiert das Modell die Referenz als Inspiration, nicht als Einschränkung.
Technische Anforderungen an die Referenz
- Komfortable Mindestauflösung: etwa 1024 Pixel auf der kürzeren Seite
- Gesicht nimmt mindestens ein Drittel des Bildausschnitts ein
- Keine Sonnenbrille, Maske oder Haare, die die Hälfte des Gesichts bedecken
- Keine starken Filter, starkes Korn oder Unschärfe
- Neutraler Hintergrund oder zumindest keine Konkurrenz zum Subjekt
Hat dein bestes Bild einen unaufgeräumten Hintergrund, lohnt sich den Hintergrund zu entfernen, bevor du es als Referenz nutzt. Den Charakter zu isolieren verringert die Chance, dass das Modell Elemente der Szenerie mitübernimmt.
Methode 3: das Turnaround-Blatt
Das ist die aus Animation und Spieleindustrie entlehnte Technik, und die effektivste für lange Serien. Statt eines Bildes erzeugst du eine Tafel mit demselben Charakter aus mehreren Winkeln und Ausdrücken und nutzt diese Tafel danach als Referenz für alles Weitere.
Die Anfrage zur Erzeugung des Blatts:
Es lohnt sich, auch eine zweite Tafel nur mit Ausdrücken zu erzeugen: neutral, lächelnd, überrascht, wütend, nachdenklich. Mit beiden zur Hand driftet der Charakter selbst in Szenen mit ungewöhnlichen Winkeln nicht mehr.
Der Aufwand beträgt eine halbe Stunde und löst den Rest des Projekts. Für Comics, Bilderbücher und jede Serie mit über zwanzig Bildern ist es die Methode, die insgesamt am meisten Zeit spart.
Methode 4: ein eigenes Modell trainieren
Einen Adapter zu trainieren — in der Praxis meist ein LoRA — ist der Weg maximaler Genauigkeit. Du sammelst 15 bis 30 Bilder des Charakters in verschiedenen Winkeln, Ausdrücken und Beleuchtungen, führst das Training durch und hast den Charakter danach fest im Modell verankert. Danach erscheint er in jeder Szene, Pose oder jedem Stil unter Beibehaltung der Identität.
Zwei ehrliche Vorbehalte. Der erste ist der Aufwand: das Bildset vorzubereiten, zu beschriften und zu trainieren dauert Stunden, und das Ergebnis hängt stark von der Qualität des Ausgangsmaterials ab. Der zweite ist, dass der Vorteil gegenüber der Referenzmethode bei aktuellen Modellen deutlich geschrumpft ist — was früher den Aufwand rechtfertigte, lohnt sich heute nur noch bei hohem Volumen.
Lohnt sich, wenn: du Hunderte Bilder desselben Charakters erzeugst, ihn in sehr unterschiedlichen Stilen brauchst, oder ein Markenmaskottchen für Jahre aufbaust. Lohnt sich nicht für: eine Serie von zehn Posts, einen Konzepttest oder ein einmaliges Projekt.
Der Ablauf, der in der Praxis funktioniert
Kombiniert man die Methoden, ist dies der Weg mit der geringsten Nacharbeit — gültig für Comics, Post-Serien, Maskottchen oder Storyboard.
- Schreibe die Bibel. Bevor du irgendetwas erzeugst, erstelle den festen Textblock des Charakters. Fünf Minuten hier sparen später Stunden.
- Erzeuge in Batches, bis du den Anker findest. Erzeuge vier Bilder auf einmal und wähle eins als endgültig. Geh nicht weiter, bis du ein Bild hast, das du als Projekt-Cover akzeptieren würdest.
- Erstelle das Turnaround-Blatt. Nutze den Anker als Referenz und erzeuge die Ansichten in mehreren Winkeln und Ausdrücken.
- Bewahre das Kit auf. Bibel als Text, Anker, Turnaround und der exakte Prompt, der alles erzeugt hat. Dieses Set ist das Kapital des Projekts.
- Erzeuge die Szenen. Für jedes neue Bild: Referenz anhängen, Bibel einfügen, nur beschreiben, was sich ändert.
- Korrigiere durch Bearbeitung, nicht durch Neuerzeugung. Ist etwas leicht falsch, verlange die punktuelle Anpassung, statt von Grund auf neu zu erzeugen.
Schritt 6 ist der Punkt, an dem die meisten Konsistenz verlieren, ohne es zu merken. Von Grund auf neu zu erzeugen wirft alles weg, was bereits stimmte. "Behalte alles und ändere nur die Lichtfarbe" zu verlangen bewahrt die Identität.
💡 Arbeite in derselben Unterhaltung. Bei konversationellen Tools ist es der günstigste Weg zur Konsistenz, im selben Gesprächsfaden zu bleiben: Das Modell übernimmt den Kontext des bereits Erzeugten. Bei jedem Bild eine neue Unterhaltung zu öffnen setzt alles zurück.
Welcher Ansatz für welche Situation
| Projekt | Empfohlene Methode |
|---|---|
| Kurze Post-Serie (bis zu 10 Bilder) | Bibel + ein Referenzbild |
| Marketingkampagne (50+ Stücke) | Mehrfachreferenz + Turnaround |
| Illustriertes Kinderbuch | Turnaround + Referenz auf jeder Seite |
| Comic | Turnaround + Ausdrucksblatt |
| Dauerhaftes Markenmaskottchen | Turnaround jetzt, Modelltraining bei wachsendem Volumen |
| Video-Storyboard | Referenz + Batch-Erzeugung in derselben Unterhaltung |
| Schneller Konzepttest | Nur die Bibel |
Zu den Tools: Konversationelle Optionen funktionieren gut, wenn du im selben Faden bleibst und Anpassungen verlangst, während solche, die mehrere Eingabebilder akzeptieren, besser abschneiden, wenn du Charakter und Szenerie verschmelzen musst. Da sich das schnell ändert, ist das praktische Kriterium, mit deinem Anker zu testen und zu vergleichen. Der Guide zu den besten KIs zum Bilder erstellen hilft bei der Wahl des Einstiegs, und der ChatGPT-Guide zum Bilder erstellen deckt den Gesprächsablauf im Detail ab.
Konsistenz ist nicht nur das Gesicht
Drei weitere Elemente driften genauso leicht, und fast niemand kontrolliert sie.
Kleidung. Das ändert sich am meisten, ohne dass man es merkt: die Anzahl der Knöpfe, der Kragenschnitt, der genaue Stoffton. Beschreibe das Stück mit zwei oder drei konkreten Details und wiederhole sie immer. Hat die Kleidung ein Muster, vereinfache es — komplexe Muster wiederholen sich nie identisch.
Charakteristisches Objekt. Ein Schwert, ein Rucksack, ein Instrument. Behandle das Objekt wie einen zweiten Charakter: Es verdient eine eigene feste Beschreibung und, in langen Projekten, ein eigenes Referenzblatt.
Visueller Stil. Ändert sich die grafische Sprache zwischen den Bildern, wirkt der Charakter inkonsistent, selbst bei gleichem Gesicht. Lege den Stil immer mit demselben Satz fest — "weiche digitale Illustration mit feinem Strich" — und variiere die Begriffe nicht. Um die Farbkohärenz zwischen in verschiedenen Sitzungen erzeugten Bildern zu stärken, lohnt sich, die Palette des Ankerbilds zu extrahieren und diese Töne in den folgenden Prompts zu nennen.
Fünf fertige Szenen-Prompts zur Wiederverwendung
Mit dem fertigen Kit wird das Erzeugen neuer Szenen mechanische Arbeit. Die fünf folgenden Vorlagen decken die meisten Bedürfnisse einer Serie ab. Ersetze in allen den Teil in eckigen Klammern durch deinen festen Block und behalte den Rest bei.
Vorstellungsporträt
Actionszene
Dialogszene
Weite Umgebungseinstellung
Emotionale Nahaufnahme
Beachte das Muster: Die ersten drei Sätze sind immer identisch, nur die Szenenbeschreibung ändert sich. Diese Wiederholung ist keine Faulheit — sie trägt genau die Konsistenz.
Die Fehler, die am meisten Drift verursachen
- Die Beschreibung mit Synonymen umschreiben. Ursache Nummer eins. Immer denselben Block kopieren und einfügen.
- Einen schlechten Anker nutzen. Dramatische Nahaufnahme, Gesicht im Schatten oder niedrig aufgelöstes Bild beeinträchtigen alles Weitere.
- Bei jedem Bild eine neue Unterhaltung öffnen. Du verlierst den angesammelten Kontext.
- Neu erzeugen statt bearbeiten. Jede Neuerzeugung von Grund auf ist eine neue Lotterie.
- Emotion statt Ausdruck beschreiben. "Traurig" variiert stark; "gesenkter Blick und geschlossener Mund" ist reproduzierbar.
- Winkel verlangen, die die Referenz nicht zeigt. Ohne Profilansicht in der Referenz ist das Profil Erfindung.
- Stile mischen. Die visuelle Sprache mitten im Projekt zu wechseln zerstört den Eindruck von Kontinuität.
- Zu viele Charaktere in derselben Szene. Die Fehlerquote steigt schnell mit der Anzahl der Gesichter.
Wie man den Charakter zurückholt, wenn er schon gedriftet ist
Hast du schon zwanzig Bilder und die Hälfte sieht nicht wie dieselbe Person aus, fang nicht von vorne an. Der Weg ist dieser:
Wähle das Bild, das den Charakter am besten repräsentiert — das, das du als Cover nutzen würdest. Es wird zum neuen offiziellen Anker. Erzeuge davon ausgehend das Turnaround-Blatt, auch wenn das Projekt schon mittendrin ist. Schreibe die Bibel neu, indem du auf dieses Bild schaust und beschreibst, was tatsächlich dort ist, nicht was du dir zu Beginn vorgestellt hast.
Danach erzeuge nur die auffälligsten Ausreißer mit der neuen Referenz neu. Oft lösen drei oder vier Neufassungen die Wahrnehmung des gesamten Sets — das Auge akzeptiert kleine Abweichungen, wenn die Mehrheit der Bilder übereinstimmt.
Nach der Erzeugung: die Bilder für den Einsatz vorbereiten
Ein Charakterset wird selten so genutzt, wie es aus der KI kommt. Drei Anpassungen decken fast alle Verwendungszwecke ab.
Charakter isolieren. Um ihn auf andere Hintergründe zu setzen, Marketingmaterial zusammenzustellen oder Sticker zu erstellen, ist den Hintergrund zu entfernen und als transparentes PNG zu speichern der entscheidende Schritt.
Größe und Gewicht vereinheitlichen. Eine Serie braucht Bilder im gleichen Format. Nutze den Größenänderer zur Vereinheitlichung und den Kompressor, um die Dateien vor der Veröffentlichung leicht zu machen.
Bildausschnitt anpassen. Ist eine Szene gut geworden, aber schlecht gerahmt, bewahrt Zuschneiden mehr Qualität, als neu zu erzeugen und zu hoffen, dass es klappt.
Checkliste für das Charakter-Kit
- Gibt es einen festen, geschriebenen und gespeicherten Textblock?
- Gibt es ein Accessoire oder Markenzeichen, das als visueller Anker funktioniert?
- Hast du ein scharfes Ankerbild mit großem Gesicht und gleichmäßigem Licht?
- Gibt es ein Turnaround-Blatt mit mindestens drei Winkeln?
- Gibt es ein Ausdrucksblatt?
- Ist der exakte Prompt, der den Anker erzeugt hat, gespeichert?
- Ist der visuelle Stil in allen Prompts mit denselben Worten beschrieben?
- Haben Kleidung und charakteristisches Objekt eine eigene, feste Beschreibung?
Sind alle Punkte erfüllt, verschwindet die Drift praktisch. Und wenn sie doch auftritt, weißt du genau, welches Teil des Kits fehlt.
Isoliere deinen Charakter als transparentes PNG
Schneide den Charakter vom Hintergrund frei für Cover, Sticker, Marketingmaterial und neue Szenen, direkt im Browser.
Hintergrund entfernen