完璧なキャラクターができあがります。2枚目はまだ似ています。3枚目では遠い親戚になり、5枚目では似た上着を着た別人です。この「ずれ」は、漫画、絵本、ブランドのマスコット、投稿シリーズ、絵コンテをAIで作ろうとする人がまず行き詰まるところです。
原因は単純で、技術論に入る前に押さえておく価値があります。画像生成モデルには記憶がありません。生成は毎回、ランダムなノイズからゼロで始まり、そのとき書いた文章だけを頼りに進みます。モデルは2分前に自分が何を作ったかを知りません。つまり一貫性とは、AIがやってくれることではなく、こちらが押しつけるものです。
幸い、押しつけるための具体的な方法が4つあり、その差は2026年のあいだにずいぶん縮まりました。かつては自前のモデル学習が要ったことも、いまではたいてい参照画像1枚と、書き方を崩さない規律だけで片づきます。この記事では4つの方法と、それぞれをいつ使うか、そして実際にうまくいく手順を扱います。なお、プロンプトはすべて英語で載せています。画像生成モデルは英語での学習が中心で、英語のまま渡したほうが結果が安定するためです。
画像と画像のあいだでキャラクターが「消える」理由
生成は毎回独立しています。同じプロンプトでも、過程のわずかな違いが別の顔を生みます。そして顔こそ、人の目がもっとも精密に違いを見つけてしまう部分です。椅子が少し違っていても気づかず受け入れられますが、鼻が2ミリ広いだけで即座に分かります。
つまり、文章だけの説明には限界があります。同じ顔をそっくり再現できるほど正確に顔を言い表すことは、どれだけ言葉を尽くしてもできません。red hair, green eyes, frecklesと書いても、それに当てはまる顔は膨大にあり、AIは毎回その中から別の一つを選びます。
ここから先、方法は二つに分かれます。説明の精度を上げるものと、模写する画像をモデルに与えるものです。前者は手早いかわりに不正確、後者は正確なかわりに準備が要ります。
💡 大原則:全体の見た目の一貫性は文章で保てます。顔の一貫性には参照画像が要ります。クローズアップを使う企画なら、参照画像は避けて通れません。
4つの方法の比較
| 方法 | 手間 | 再現度 | 向いている用途 |
|---|---|---|---|
| キャラクター設定シート(文章のみ) | とても少ない | 中程度 | 引きの構図、様式化されたイラスト、点数の少ない制作物 |
| 参照画像 | 少ない | 高い | 大半の企画。投稿、キャンペーン、漫画 |
| 三面図シート | 中程度 | とても高い | 長期シリーズ、漫画、絵本 |
| モデルの学習(LoRA) | 多い | 最高 | 数百枚規模、何年も使うキャラクター |
いまの状況で重要なのは、参照画像と学習の差がかなり縮まったことです。販促、SNS、一般的な商用コンテンツであれば、参照画像の運用を整えるだけで、何も学習させずに実務水準の結果が出ます。学習が意味を持つのは、量が非常に多い場合か、再現度に一切の妥協ができない場合です。
方法1:キャラクター設定シート
他のすべての方法の土台であり、たいていの人が飛ばしてしまう工程です。設定シートとは、変えてはいけないものをすべて書いた固定の文章のかたまりで、これを一字一句そのまま、すべてのプロンプトに貼りつけます。
書くべきこと
変わらず、かつ目に見えるものだけです。見た目の年齢、顔の輪郭、髪の色と長さ、目の色、肌の色、特徴的な印、いつもの服装、そして固有の小物。もっとも過小評価されているのが小物です。傷跡、丸眼鏡、赤いマフラー、タトゥーなどは視覚的な目印として働き、顔が多少ぶれても読み手がキャラクターだと分かる助けになります。
書いてはいけないこと
場面ごとに変わるものすべて。姿勢、表情、背景、光、角度です。これらを設定シートに混ぜると、今度はどの画像も同じになってしまいます。正反対の問題です。
そのまま使えるひな形
彼女がどこにいて何をしているかは、一切書かれていない点に注目してください。この文はどのプロンプトにもそのまま入り、場面の説明はそのあとに続きます。
この方法を台なしにする失敗
言い換えて書き直すことです。brown leather jacketとcaramel-coloured leather coatは別の服を生みます。言葉が安定していることが、画像の安定を支えます。書き直さず、コピーして貼りましょう。
方法2:参照画像
いまいちばん使われていて、費用対効果も最も良い方法です。キャラクターの画像を1枚渡すと、モデルがその見た目の特徴を取り出し、新しい場面で再現します。
基準画像の選び方
どんな画像でもよいわけではありません。理想的な基準画像は、顔が大きくはっきり写り、正面か少し斜めからの光で強い影がなく、表情は自然で、背景も単純なものです。顔の半分が影に落ちた劇的なクローズアップは、どれだけ絵として美しくても最悪の参照になります。モデルが必要とする情報の半分が見えていないからです。
1枚か、複数枚か
1枚でも機能します。角度の違う2〜3枚ならさらに良く、特に元の参照にない姿勢や角度を求めたときに差が出ます。複数入力に対応しているツールなら、使わない手はありません。
参照画像つきのプロンプトの書き方
うまくいく組み立て方はいつも同じです。変わらないものを固定し、変わる部分だけを書きます。
keep ... exactly the sameという一文は、見た目以上の働きをします。これがないと、モデルは参照画像を制約ではなく着想の材料として受け取ります。
参照画像の技術的な条件
- 解像度は短辺で1024ピクセル程度あると安心
- 顔が画面の3分の1以上を占めていること
- サングラス、マスク、顔半分を覆う髪がないこと
- 強いフィルター、目立つノイズ、ぼけがないこと
- 背景は無地か、少なくとも被写体と張り合わないもの
いちばん良い画像の背景がごちゃついているなら、参照に使う前に背景を削除しておくとよいでしょう。キャラクターだけを切り出しておけば、背景の要素まで引きずられる可能性が下がります。
方法3:三面図シート
アニメーションやゲーム業界から借りてきた手法で、長期シリーズにはこれがいちばん効きます。1枚の画像ではなく、同じキャラクターを複数の角度と表情で並べた1枚の設定画を作り、それ以降すべての参照に使います。
設定画を生成するときの指示です。
表情だけを並べた2枚目も作っておくとよいでしょう。無表情、笑顔、驚き、怒り、思案顔など。この2枚がそろえば、変わった角度が必要な場面でもキャラクターはぶれなくなります。
かける時間は30分ほどで、それで企画の残り全部が片づきます。漫画、絵本、そして20枚を超えるシリーズなら、通算でいちばん時間を節約できる方法です。
方法4:自分でモデルを学習させる
アダプター(実質的にはLoRAを指すことがほとんどです)を学習させるのが、再現度では最上の道です。角度、表情、光の条件を変えたキャラクターの画像を15〜30枚そろえ、学習を回すと、そのキャラクターがモデルに組み込まれます。以降は、どんな場面、姿勢、絵柄でも同一人物のまま登場させられます。
正直な注意が2つあります。1つは手間です。画像を集め、説明文を付け、学習を回すまでに何時間もかかり、結果は素材の質に大きく左右されます。もう1つは、参照画像方式に対する優位がいまのモデルではかなり小さくなったことです。以前ならこの手間に見合ったものが、いまでは量が多い場合にしか見合いません。
見合うのは、同じキャラクターを数百枚生成する場合、まったく違う絵柄で使う必要がある場合、あるいは何年も使うブランドのマスコットを作る場合です。10本の投稿シリーズ、試しの検証、単発の企画には見合いません。
実際にうまくいく手順
これまでの方法を組み合わせた、やり直しがいちばん少なくて済む道筋です。漫画でも、投稿シリーズでも、マスコットでも、絵コンテでも同じように使えます。
- 設定シートを書きます。何かを生成する前に、キャラクターの固定文をまとめておきます。ここでの5分が、あとで何時間もの節約になります。
- 基準画像が出るまで数を出します。一度に4枚ずつ生成し、その中から1枚を決定版に選びます。企画の表紙に使えると思える1枚が出るまで、先へ進んではいけません。
- 三面図シートを作ります。基準画像を参照にして、複数の角度と表情を生成します。
- 一式を保管します。設定シートの文章、基準画像、三面図、そしてそれらを生んだプロンプトそのもの。この一式が企画の資産になります。
- 各シーンを生成します。新しい画像ごとに、参照画像を添付し、設定シートを貼りつけ、変わる部分だけを書きます。
- 作り直さず、直します。少しだけ違う結果になったときは、ゼロから生成し直すのではなく、その部分だけの修正を依頼します。
6番目で、多くの人が気づかないまま一貫性を失います。ゼロから作り直すのは、すでに合っていたものまで捨てる行為です。keep everything and change only the colour of the lightのように頼めば、同一性は保たれます。
💡 同じ会話の中で進めましょう。対話型のツールでは、同じスレッドに留まることが、一貫性を保つもっとも安上がりな方法です。すでに生成したものの文脈をモデルが引き継いでくれます。画像ごとに新しい会話を開くのは、そのたびにゼロからやり直すのと同じです。
状況別のおすすめ
| 企画 | おすすめの方法 |
|---|---|
| 短い投稿シリーズ(10枚まで) | 設定シート+参照画像1枚 |
| 販促キャンペーン(50点以上) | 複数の参照画像+三面図 |
| 絵本 | 三面図+全ページで参照画像を使用 |
| 漫画 | 三面図+表情シート |
| 長く使うブランドマスコット | まず三面図。量が増えたらモデルの学習へ |
| 動画の絵コンテ | 参照画像+同じ会話内でまとめて生成 |
| 手早い検証 | 設定シートのみ |
ツールについて。対話型のものは、同じスレッドに留まって少しずつ調整を頼む使い方に向いています。複数の画像を入力できるものは、キャラクターと背景を合成したいときに強みが出ます。この分野は動きが速いので、実際に自分の基準画像で試して見比べるのがいちばん確実です。どこから始めるかは画像生成AIのおすすめ比較が参考になり、会話での進め方はChatGPTで画像を作るガイドで詳しく扱っています。
一貫性は顔だけの話ではない
同じくらい簡単にずれてしまうのに、ほとんど誰も管理していない要素が3つあります。
服装。気づかないうちにいちばん変わるのがここです。ボタンの数、襟の形、生地の色味。具体的な特徴を2〜3点に絞って書き、毎回同じ表現を使いましょう。柄物なら単純にすること。複雑な模様が同じように再現されることはまずありません。
持ち物。剣、リュック、楽器など。持ち物は二人目の登場人物だと考えましょう。固定の説明を持たせるだけの価値があり、長期の企画なら専用の設定画を作ってもよいくらいです。
絵柄。画像ごとに絵の言語が変わると、顔が同じでもキャラクターは別人に見えます。絵柄も毎回まったく同じ一文で固定し、言い回しを変えないこと(例:soft digital illustration with fine linework)。別の日に生成した画像どうしで色味をそろえたいときは、基準画像から色を抽出して、以降のプロンプトでその色を指定するとよいでしょう。
そのまま使える5つのシーン用プロンプト
一式がそろえば、新しい場面の生成は機械的な作業になります。以下の5つのひな形で、シリーズに必要な場面のほとんどをまかなえます。いずれも、角かっこの部分を自分の固定文に置き換え、それ以外はそのままにしてください。
紹介用のポートレート
アクションの場面
会話の場面
情景を見せる引きの構図
感情を映すクローズアップ
作りに注目してください。最初の3文はつねに同じで、変わるのは場面の説明だけです。この繰り返しは手抜きではなく、まさにそれが一貫性を支えています。
ずれを招く失敗
- 説明を言い換えて書き直す。最大の原因です。毎回まったく同じ文をコピーして貼りましょう。
- 基準画像の選び方が悪い。劇的なクローズアップ、影に沈んだ顔、低解像度の画像は、そのあとすべてを台なしにします。
- 画像ごとに新しい会話を開く。積み上げた文脈が失われます。
- 直さずに作り直す。ゼロからの再生成は、そのたびにくじを引き直すのと同じです。
- 表情ではなく感情を書く。sadでは毎回ばらつきますが、eyes downcast and mouth closedなら再現できます。
- 参照画像にない角度を求める。横顔が写っていない参照から出てくる横顔は、モデルの創作です。
- 絵柄を混ぜる。途中で絵の言語を変えると、続きものとしての感覚が崩れます。
- 同じ場面に登場人物を詰め込む。顔の数が増えるほど、失敗する確率は急に上がります。
すでにずれてしまったときの立て直し方
すでに20枚あって、その半分が別人に見えるとしても、ゼロからやり直す必要はありません。次の順で立て直します。
そのキャラクターをいちばんよく表している画像——表紙に使うならこれ、という1枚——を選びます。それが新しい公式の基準画像です。企画がすでに途中でも、そこから三面図シートを作ります。設定シートも、その画像を見ながら書き直します。最初に頭の中で思い描いたものではなく、実際にそこに写っているものを書くのがポイントです。
そのうえで、いちばん浮いている画像だけを新しい参照で作り直します。3〜4枚直すだけで全体の印象が整うことも珍しくありません。大多数の画像が互いに一致していれば、人の目は多少のばらつきを受け入れるからです。
生成したあと——実際に使うための下ごしらえ
キャラクターの画像一式が、AIから出てきたそのままの形で使われることはまずありません。次の3つの調整で、たいていの用途に対応できます。
キャラクターを切り出す。別の背景に載せる、販促物を組む、スタンプを作るといった用途では、背景を削除して透過PNGで保存するのが欠かせない一手です。
サイズと容量をそろえる。シリーズものは、画像の形式がそろっている必要があります。サイズ変更で寸法を統一し、公開前に圧縮でファイルを軽くしましょう。
構図を整える。絵は良いのに枠の取り方がいまひとつというときは、画像の切り抜きのほうが、生成し直して当たりを祈るより画質を保てます。
キャラクター一式のチェックリスト
- 固定の設定文を書いて保存してあるか?
- 視覚的な目印になる小物や特徴があるか?
- 顔が大きく写り、光が均一で、はっきりした基準画像があるか?
- 3方向以上を収めた三面図シートがあるか?
- 表情シートがあるか?
- 基準画像を生成したプロンプトそのものを保存してあるか?
- 絵柄がすべてのプロンプトで同じ言葉で書かれているか?
- 服装と持ち物に、それぞれ固定の説明があるか?
これらがすべてそろっていれば、ずれはほぼ起きません。それでも起きたときは、一式のどれが欠けているのかがすぐ分かります。