二人が同じ日に、同じAIで、同じ画像のアイデアを生成します。一方には雑誌から抜き出したような絵が返り、もう一方には、手がゆがみ色もおかしい、ぱっとしないぼんやりした絵が返ります。この差がツールにあることは、まずありません。差はプロンプトにあります。

プロンプトとは、ほしい画像を説明するために書く文章のことです。単純そうに見えますが、単純そうに見えるからこそ、多くの人が拙いプロンプトを書いてしまいます。短い一文を打ち、生成を押し、平凡な結果を見て「AIもたいしたことないな」と結論づけるわけです。実際にはモデルは頼まれたとおりのものを返しています。曖昧だったのは頼み方のほうです。

この記事では、素人のプロンプトと職業的なプロンプトを分ける組み立て方を扱います。良いプロンプトを構成する6つの層、結果を実際に変える専門用語、語順がAIの優先順位に与える影響、同じプロンプトを別のツール向けに直す方法、そして生成が始まる前から画像を台なしにする失敗まで。どれもコピーして手直しできる例つきです。なお、この記事のプロンプトはすべて英語で載せています。画像生成モデルは英語での学習が中心で、そのまま渡したほうが結果が安定するためです。

多くのプロンプトがありきたりな画像を生む理由

画像生成モデルは、説明文の付いた何億枚もの画像から学んでいます。a dogとだけ書かれても、モデルは、見てきた何百万枚もの犬の写真のどれを手本にすべきか判断する材料を持ちません。そこで統計的な仕組みなら当然のことをします。平均を返すのです。そして、すべての平均こそが「ありきたり」と呼ばれるものです。

曖昧なプロンプトは、創作の自由として受け取られるわけではありません。情報がないものとして受け取られ、その空白は学習データでもっとも頻度の高い型で埋められます。中央に置かれた被写体、特徴のない光、ぼけた背景、先の読める構図です。短いプロンプトが、安価なストックフォトのような画像を生みがちなのはこのためです。

逆方向にも落とし穴があります。矛盾する形容詞を詰め込んだ80語のプロンプトは、モデルの注意を多すぎる概念に分散させ、どれもきちんと反映されない結果を招きます。ちょうどよいのはその中間、具体的で、層に整理されていて、重複も矛盾もない説明です。

💡 実用的な目安:そのプロンプトで1000通りの違う画像が説明できてしまうなら、曖昧すぎます。逆に、なぜその単語が入っているのかを説明できないなら、長すぎます。

効くプロンプトの解剖——6つの層

質の高いプロンプトは、ツールを問わず、ほぼすべて6つの層に分解できます。毎回すべてを使う必要はありませんが、意識して埋めた層が多いほど、AIが勝手に決める余地は減ります。

1. 被写体 — 何が写っているか

プロンプトの核であり、いちばん書き方を誤られる部分でもあります。書く量が少なすぎるのです。a womanも被写体です。a middle-aged woman, grey hair pulled into a bun, white lab coatも被写体で、結果の差は歴然としています。おおよその年齢、服装、目立つ特徴、表情、姿勢を書きましょう。要素が複数あるなら、その関係も決めます。誰が手前で、誰が奥で、誰が何に関わっているのか、という具合です。

2. 動きと構図 — 何が起きていて、どう切り取るか

被写体が何をしていて、どの角度から見ているかを書く層です。close-upmedium shotcowboy shotaerial viewlow angleextreme close-upsymmetrical framingrule of thirdsといった語は、画像の読まれ方をまるごと変えます。この層がないと、AIはほぼ必ず、正面から中央に置いたミディアムショットを返してきます。

3. 場所 — どこで起きているか

背景、時代、天候、状況です。in a kitchenでは弱い。in a stainless-steel commercial kitchen, pans hanging in the background, steam risingなら奥行きが生まれ、モデルは背景を筋の通った形で埋める材料を得ます。場所は光や色調の情報も暗に含むので、プロンプトの他の部分も助けます。

4. 光 — もっとも軽んじられている層

この記事から1つだけ持ち帰るなら、これにしてください。画像をプロらしく見せるのは光です。soft natural lightside window lightgolden hourblue hourharsh midday lightbacklightneon lightstudio lighting with a softboxRembrandt lightingvolumetric light through dust。こうした語の一つひとつが、モデルの中の視覚的な蓄積をまるごと呼び出します。光の指定がないプロンプトには、平坦で個性のない光が返ってきます。

5. 絵柄 — 視覚の言語

写実的な写真、ベクターイラスト、水彩、油彩、コンセプトアート、ドット絵、3Dレンダー、エディトリアル調、北欧のミニマリズム、サイバーパンク、アニメ。この層が画像の「言語」を決めます。典型的な失敗は、相容れない絵柄を同じプロンプトに混ぜることです。水彩と写実的な3Dレンダーを同時に頼めば、モデルが両方に応えようとして、不格好な折衷になります。

6. 技術 — カメラ、素材、仕上げの細部

写実的な画像を職業水準まで押し上げるのがこの層です。85mm lensf/1.8shallow depth of fieldhigh resolution35mm film texturesubtle graincalibrated coloursなど。イラストであれば、これに当たるのは線の質、線の太さ、紙の質感、配色の指定です。

弱いプロンプトから強いプロンプトへ——5つの実例

前後を並べて見ると、理屈がはっきりします。以下の各組で、2つ目のプロンプトは先ほどの層をそのまま使っています。

ポートレート

❌ photo of a man in a suit
✅ Corporate portrait of a 40-year-old man, well-cut navy suit, white shirt with no tie, confident and relaxed expression, medium shot, blurred office background with large windows, soft natural side light coming from the left, 85mm f/1.8 lens, shallow depth of field, high-resolution editorial photography

商品写真

❌ a nice perfume
✅ Amber glass perfume bottle with a gold cap on a white marble surface, water droplets on the surface, light grey gradient background, studio lighting with a side softbox and a reflector, soft reflection at the base, slightly raised frontal close-up, advertising product photography, ultra sharp

イラスト

❌ a drawing of a fox
✅ Illustration of a red fox sitting in an autumn forest clearing, leaves falling around it, watercolour children's book style, visible light pencil linework, warm palette of oranges and ochres, light filtering through the trees, centred composition with negative space above

建築とインテリア

❌ modern living room
✅ Minimalist Scandinavian living room, beige linen sofa, light oak coffee table, textured wool rug, large plant in the corner, exposed concrete wall, floor-to-ceiling window on the right, diffuse natural late-afternoon light, photorealistic architectural render, wide shot at eye level

映画的な場面

✅ Woman in a long coat walking alone down a wet street at night, red and blue neon reflections on the asphalt, low fog, backlit silhouette, wide shot with a central vanishing point, 1980s cinematic look, film grain, desaturated colours with saturated highlights

語順が、AIの優先順位を変える

ほぼすべての画像モデルで、プロンプトの前のほうに書かれた語は、後ろの語より重く扱われます。つまり語順は飾りではなく、制御の手段だということです。

いちばん安定する並びは、被写体から始めて、動きと構図、場所、光、絵柄と続き、最後に技術的な細部を置くものです。その画像でいちばん大事なのが場所であれば——たとえば風景写真なら——順序を入れ替えて場所から始めます。原理は単純で、先に書かれたものから順に、AIは合わせにいきます。

語順にはもう一つ、希釈という実際的な効果があります。プロンプトが長いほど、一語あたりの相対的な重みは下がります。よく選んだ25語のプロンプトのほうが90語のものより良い結果になりがちなのは、90語では競い合う概念のあいだにAIの注意が散るからです。

💡 切り分けのコツ:大事な要素が画像に出てこなかったら、何を試すより先に、その語をプロンプトの先頭へ移しましょう。たいていはそれで解決します。

結果を実際に変える専門用語

漠然とした形容詞と専門用語のあいだには、大きな差があります。beautifulamazinghigh qualitymasterpieceといった語は、学習データの中で具体的な見た目の型と結びついていないため、画像をほとんど変えません。一方、写真家やイラストレーター、アートディレクターが使う用語は、正確な近道として働きます。

やりたいことこう書くのではなくこう書く
背景をぼかしたいnice backgroundshallow depth of field, f/1.4, soft bokeh
柔らかく人がきれいに見える光good lightingdiffuse natural window light, golden hour
映画のような画film stylecinematic look, 35mm film grain, desaturated colours50のプロンプト
すっきりした商品写真professional photostudio lighting, side softbox, white seamless background
高さを感じさせたいfrom aboveaerial view, top-down shot, drone at 40 metres
堂々とした人物looking stronglow angle, looking up, silhouette against the sky
線の見えるイラストcute drawingvisible pencil linework, paper texture, watercolour
くっきり細部まで見える画像high qualityhigh resolution, sharp focus on the eyes, fine texture detail

考え方はいつも同じで、評価を描写に置き換えることです。AIはあなたが何を美しいと思うかを知りませんが、開放に近い85mmレンズがどういうものかはよく知っています。

ネガティブプロンプト——ほしくないものを伝える

AI画像の問題の多くは、情報を足すことではなく、取り除くことで解決します。ネガティブプロンプトは、避けたいものを並べるための独立した入力欄(ツールによってはパラメータ)です。

定番のネガティブプロンプトに入れておくと得なのは、deformed handsextra fingersduplicated limbsdistorted facesillegible textwatermarksignatureframelow resolutionunwanted blurexcessive noiseincorrect anatomyあたりです。商品写真なら、blown-out reflectionshard shadowscluttered backgroundも足しておきましょう。

重要な点が一つ。ネガティブプロンプトは、漠然とした形容詞を置く場所ではありません。uglybadと書いても何も起きません。消したい不具合を具体的に書きましょう。手がおかしく出たなら、書くのはbad handsではなくdeformed hands, extra fingersです。

専用のネガティブ欄がないツールもあります。ChatGPTのように会話で進めるモデルでは、指示そのものの中に制約を書き込み、できるだけ肯定形にするのが代わりの方法です。no textと書くより、clean composition with no typographic elementsと頼みましょう。モデルは否定形より肯定形の指示をよく理解します。

パラメータ——比率、シード値、プロンプトの強さ

文章のほかに、ほとんどのツールには数値の設定があり、その影響は言葉に劣りません。主なものを知っておくと、やり直しがぐっと減ります。

パラメータ何をするもの調整するとき
比率(アスペクト比)1:1、4:5、16:9、9:16、3:2など、画面の形を決める毎回。生成の前に決めること。あとから切り抜かない
シード値ランダムな出発点を固定する数値気に入った画像の別案がほしいとき
プロンプトの強さ(CFG/ガイダンス)文章にどこまで忠実に従うか細部が無視されるなら上げ、画が硬く不自然なら下げる
ステップ数生成中に画を練り上げる工程の回数中くらいの値で足りることが多い。上げすぎても時間に見合わない
参照の強さ下地として渡した画像の効き具合絵柄や構図の参考に画像を使うとき

比率はSEOにもSNSにも直接効くので、特に気をつけたいところです。1:1で生成してから9:16に切り抜くと、ピクセルが無駄になるうえ、構図もおかしなところで切れます。はじめから最終的な比率で生成しましょう。比率が合っていないのに、切ると大事なものが失われる場合は、AIで画像を拡張するのが答えです。どうしても切り抜くしかないときは、画質を保てるツールを使いましょう。画像の切り抜きなら余計な再圧縮は入りません。

同じプロンプトを別のツール向けに直す

あるツール向けに書いたプロンプトが、別のツールでも同じように効くことはまれです。優劣の問題ではなく、学習のされ方が違い、期待している指示の書き方も違うからです。

ツールの種類好むプロンプトの形おすすめの直し方
対話型のモデルデザイナーに説明するような、自然で完結した文章文章で書き、会話の途中で修正を頼める(ChatGPTのガイド
語句を並べる型のモデル重要な順に、カンマで区切った語句の並び冠詞や接続語は削り、画を持つ語だけを残す
文字の描写が得意なモデル入れたい文字を引用符でくくった直接的な指示書体と、画像内での文字の位置まで指定する
ローカルで動かすオープンなモデル語句の並び+独立したネガティブプロンプトネガティブ欄をしっかり使う。効果がいちばん大きい

実務では、文章で書いた「原本」と、カンマ区切りに詰めた短縮版の2つを持っておきましょう。この2つを使い分ければ、いま出回っているツールのほとんどに対応できます。どれを使うか決めかねているなら、画像生成AIのおすすめ比較で見比べてみてください。

画像の種類別——何を優先すべきか

ポートレート・人物写真

光とレンズを最優先に。柔らかい横からの光と浅い被写界深度の組み合わせで、仕事の大半は片づきます。抽象的な感情ではなく、顔の表情を書きましょう。happyよりsubtle smile, looking straight into the cameraのほうがうまくいきます。同じ場面に大勢を入れるのは避けてください。人数が増えるほど顔の失敗率は急に上がります。照明の組み方までそろえたポートレート用の50プロンプトも用意しています。

商品・ECサイト

背景、素材、映り込みを最優先に。商品を置いている面、背景の種類、光の向きを書きましょう。白のシームレス背景に横からのソフトボックスが、モールの定番です。そのまま使える商品写真用の50プロンプトもあります。生成したあとは、たいてい商品だけを切り出す必要が出てきます。いちばん早いのは背景を削除して透過PNGで保存する方法です。

ロゴ・ブランドの視覚要素

単純さと形を最優先に。ロゴは他と逆で、短いプロンプトを求めます。図案、色数、様式(幾何学的、有機的、モノライン)を書き、背景は無地に指定します。形容詞が多すぎると、要素が詰まりすぎて縮小に耐えないマークになります。複雑なイラストがマークとして機能しないのは、小さくすると消えてしまうからです。業種別に整理したロゴ作成用の50プロンプトもあります。

建築とインテリア

素材と時間帯を最優先に。この考え方で組んだ建築・インテリア用の50プロンプトがあります。打ちっぱなしのコンクリート、明るいオーク、リネン、ヘアライン仕上げの真鍮といった実在の素材名を挙げるほうが、様式を表す形容詞よりずっと写実的になります。時間帯は光を決め、光は雰囲気そのものを決めます。夕方は温かく親しみやすい画に、真昼は硬く冷たい画になります。

キャラクター・イラスト

一貫性を最優先に。画像をまたいで繰り返すべき固定の特徴を書きましょう。髪の色と形、目の色、いつもの服、傷跡、目を引く小物など。シリーズのプロンプトすべてでまったく同じ説明を使い回し、ツールが対応していればシード値も固定します。これが、違う場面でも同じ人物を保つ方法です。4つの手法はAIでキャラクターの一貫性を保つ方法で詳しく扱っています。

壁紙・背景画像

比率と余白を最優先に。スマートフォンなら9:16、パソコンなら16:9で直接生成し、アイコンや時計が乗る位置に何もない領域を作るよう指定します。この形で組んだ壁紙用の50プロンプトがあります。あとは自分の端末の解像度に合わせてサイズ変更するだけです。

プロンプトを台なしにする8つの失敗

  1. 中身のない形容詞を積む。amazing, beautiful, masterpiece, 8K, ultra detailedはプロンプトの場所を取るだけで、目に見える情報を何も足しません。
  2. 相容れない絵柄を混ぜる。水彩と写実的な3Dレンダー、ドット絵と写真など。モデルは両方に応えようとして、どちらにもなりません。
  3. 見た目ではなく感情を書く。AIにnostalgiaは描けません。描けるのは、温かい光、フィルムの粒子、色あせた色調です。
  4. 光を書かない。いちばん多く、いちばん高くつく失敗です。光の指定がなければ、画は平坦になります。
  5. 画像内の文字を曖昧に頼む。文字が重要なら、引用符でくくって書き、どこに、どんな書体で入るかまで指定しましょう。
  6. プロンプトが長すぎる。60語あたりを超えると、語を足すたびに前の語が弱まります。
  7. ネガティブプロンプトを使わない。繰り返し出る不具合の半分は、よく練った除外リストで消えます。
  8. 違う比率で生成する。あとから切り抜けば構図は壊れ、解像度も無駄になります。

プロンプトを詰めるための3周法

良いプロンプトが一発で生まれることはまれです。初心者にありがちな失敗は、試すたびに全部を書き直してしまうことで、これでは何が効いたのか分かりません。次の方法なら、一度に一つの要素だけを切り分けられます。

1周目 — 骨組み。6つの層でプロンプトを書き、4枚生成して、見るのは1点だけです。構図は合っているか。被写体、切り取り方、場所は思い描いたとおりか。違えば、絵柄や光には触れず、被写体と構図だけを直します。

2周目 — 雰囲気。構図が固まったら、光、色調、絵柄を調整します。1回の生成で変えるのは1要素だけ。diffuse natural lightlate-afternoon backlightに替えて、その効果だけを見るほうが、当てずっぽうに10回試すより多くを学べます。

3周目 — 仕上げ。ここで技術的な細部とネガティブプロンプトが入り、ツールが対応していれば、気に入った画像の別案を出すためにシード値を固定します。細かい粗を、生成し直すのではなく編集で直すのもこの段階です。

💡 うまくいったプロンプトは残しておく。自分の良かったプロンプトを画像の種類ごとに並べただけの簡単なファイルが、どんな小技よりも時間を節約します。出発点がほしければ、12カテゴリに分けたコピーしてすぐ使える100のプロンプトがあります。良いプロンプトは、被写体を少し入れ替えるだけで何度でも使えます。

生成したあと、画像をどうするか

生成は仕事の半分です。AIから出てきた画像が、そのまま公開できる状態であることはまずありません。たいていはウェブには重すぎ、形式も合っておらず、最後の調整も済んでいません。

3つの手順で、たいていの場合は片づきます。まず、用途に合った形式に変換します。サイトならWebP、透明が要るならPNG、普通に送るだけならJPGです。変換ツールならブラウザだけで済みます。次に、ファイルを軽くします。高解像度のAI画像は簡単に5 MBを超え、どんなページの表示速度も落としますが、圧縮を使えば見た目を変えずに大きく削れます。最後に、輪郭がやや甘く出たときは、公開前にシャープ化をかけておくとよいでしょう。

ブランドのビジュアルであれば、ほとんど誰もやっていない一手がもう一つあります。生成した画像から色を抽出して、他の制作物にも使い回すことです。これだけで、別の日に作った画像どうしでも見た目の統一が取れます。

生成前のプロンプト・チェックリスト

すべてに「はい」と答えられるなら、1回目の生成から使えるものが出る可能性は高いでしょう。出なかったときも、どの層を直せばよいかがはっきり分かります。そこが、運でAIを使う人と、方法でAIを使う人を分ける境目です。

さっそく実践してみましょう

自分のブランドを短い言葉で説明するだけで、組み立てのよいプロンプトが数秒でロゴになります。ブラウザだけで完結します。

AIでロゴを作る

よくある質問

画像生成のプロンプトは、どのくらいの長さがちょうどいいですか?
英語で25〜60語程度が、たいていの場合ちょうどよい長さです。これより短いとAIが学習データの平均で隙間を埋めてしまい、ありきたりな画像になります。長すぎると語どうしが競い合い、モデルの注意が散って、どれもうまく反映されなくなります。例外はロゴで、10〜20語の短いプロンプトのほうがうまくいきます。マークには形の単純さが求められるからです。
プロンプトは英語で書いたほうがよいですか?
この記事のプロンプトはすべて英語で載せています。画像生成モデルは英語のキャプションを中心に学習しているため、特に撮影や美術の専門用語は英語のまま渡したほうが結果が安定するからです。最近のモデルは日本語もかなり理解しますが、bokeh、golden hour、low angleといった用語は英語での学習量が桁違いに多く、そのまま書くのが確実です。日本語で組み立てて専門用語だけ英語にする書き方でも十分に機能します。
AIが手や文字をこれほど間違えるのはなぜですか?
手は姿勢の幅が非常に広く、学習に使われた写真では一部が切れていたりぼけていたりすることが多いため、モデルが安定した構造を学びにくいのです。文字も似た事情で、モデルが学ぶのは字の見た目であって、書くという行為そのものではありません。最近のバージョンではかなり改善しました。それまでは、ネガティブプロンプトに deformed hands, extra fingers を入れ、手が目立つ姿勢を避け、文字が重要なときは引用符でくくって書くか、あとから編集ツールで足しましょう。
複数の画像で同じキャラクターを保つには?
効くことが3つあり、できれば3つとも組み合わせるのが理想です。まず、髪の色と長さ、目の色、いつもの服、目を引く小物といった具体的な特徴で、キャラクターの説明文を固定します。そしてその説明を、言い換えずにまったく同じ形ですべてのプロンプトで繰り返します。次に、ツールが対応していればシード値を固定します。最後に、画像入力に対応しているなら、それまでにいちばんよく出た画像を次からの参照に使います。
8Kultra detailedmasterpieceといった語は効きますか?
古いモデルではよく効きました。評価の高い画像への統計的な近道として働いていたからです。いまのモデルでは効果は小さく、ときには逆効果にもなります。目に見えるものを何も説明しないまま、プロンプトの場所を占めてしまうからです。ほしい仕上がりを実際に描写する言葉に置き換えましょう。ピントの合った部分のシャープさ、肌の質感が見えること、フィルムの粒子、細部まで解像していること、といった具合です。
AIが生成した画像を商用で使えますか?
使うツールの規約と、その国の法律によります。しかも規則はよく変わります。商用利用を認めているサービスは多いものの、有料プランを条件にするところもあれば、生成物の著作権登録を制限しているところもあります。クライアント向けの制作物や販売する商品に使う前には、そのツールの規約を必ず読み、存命の作家名や登録商標を名指しするプロンプトは避けましょう。