AIで画像を作り始めた人のほとんどは、何か月ものあいだプロンプトの文章だけで結果を良くしようとします。「きれい」を「息をのむような」に変え、「8K」「超高精細」「傑作」を足していく。それでも仕上がりはたいして変わりません。理由は単純で、最終的な絵を決めている要素の多くは文章の中になく、 パラメータ.

パラメータとは、モデルに対して何を描くかではなく、 どう 描くかを指示する数値のことです。 画面の比率 、文章にどこまで従わせるか、何段階かけて描き込むか、どの乱数の種を使うか、美的な裁量をどれだけ与えるか。ランダムに10枚出すだけの人と、意図をもって同じ絵を再現し、調整し、育てていける人を分けているのがこれらの値です。

この記事は、ほぼすべてのツールに共通して現れる5つのパラメータ、すなわち アスペクト比、seed、CFG、stylize、steps を中心に、周辺の設定もあわせて整理した技術リファレンスです。それぞれの値が何をするのか、どの範囲を動かすのか、やりすぎると何が壊れるのかを、必要になったときに読み返せる形にまとめました。

形容詞よりパラメータが効く理由

拡散モデルは、まったくのノイズから出発し、それを段階的に「片づけて」いくことで画像にたどり着きます。プロンプトは目的地を示す地図で、パラメータはそこへ至る道路と速度、そして運転手にどれだけ寄り道を許すかを決めるものです。

これで、同じプロンプトからまるで違う絵が出てくる理由も、形容詞を足しても何も変わらないことが多い理由も説明がつきます。文章への従順さがすでに低い設定(CFGが低い状態)なら、言葉を足しても意味がありません。モデルがそれをあまり見ていないからです。stepsが少なすぎれば、どんな形容詞も質感を救えません。細部を詰めるだけの回数がそもそも足りていないのです。

初心者と経験者を分ける習慣は、次の一点に尽きます。 一度に変えるのは1つだけ。プロンプトもseedもCFGも同時に変えてしまえば、何が効いたのかわかりません。seedを固定してCFGだけを動かせば、変数がひとつに絞られ、そのモデルの癖が本当に見えてきます。

💡 ヒント: 調整に入る前に、同じプロンプトと初期設定のまま4枚生成してください。それがそのモデルの「出発点」です。値を動かし始めるのはそのあとで、しかも必ず1つずつ。

アスペクト比:構図そのものを決める値

アスペクト比とは、画像の幅と高さの比率です。Midjourneyでは --ar 16:9のように書きます。Stable Diffusion系では幅と高さをピクセルで指定し、ChatGPTやGeminiでは「9:16の縦長で」と言葉で伝えれば足ります。

一見いちばん平凡なパラメータに見えますが、実は 構図に最も強く効きます。モデルは同じ絵を別の形に切り取るのではなく、構図そのものを組み直すからです。16:9で頼んだ人物写真は背景の広いミドルショットになりがちですが、同じプロンプトを2:3にすると、写真らしい縦位置の寄りになります。比率が変われば、AIがその場面にとって「自然な収まり」と考えるものが変わるのです。

よく使う比率と用途

比率主な用途モデルが取りやすい構図
1:1アイコン、Instagramのフィード、商品サムネイル被写体を中央に置き、背景を簡素にする
4:5InstagramやFacebookの縦長投稿ミドルショット。被写体の存在感が出る
2:3人物写真、ポスター、書籍の表紙寄りまたはウエストショット。雑誌的な絵づくり
9:16ストーリーズ、リール、TikTok、スマホの壁紙縦構図。上下に大きく余白が生まれる
16:9YouTubeのサムネイル、バナー、映画的な場面引きの構図。風景や周囲の状況が入る
21:9シネマスコープ風、サイトのメインビジュアルパノラマ。画面内で被写体は小さくなる
3:1ヘッダーバナー、LinkedInのカバー細長い横帯。かなり具体的なプロンプトが必要になる

よくある落とし穴が、3:1や1:3のような極端な比率です。学習データの大半が正方形に近い画像であるため、モデルは混乱します。顔が2つ、頭が2つ、端で同じ要素が繰り返される、といった重複が起きるのは、確かな手がかりのない空間をモデルが埋めようとするからです。こうした場合は、まず16:9で生成し、そのあと 画像の切り抜き やアウトペインティングで最終的な形に広げるのが安全です。

もうひとつ実務的な話をすると、あとから切るより、最初から目的の比率で生成するほうが常に有利です。トリミングはピクセルを捨て、使える解像度を減らします。同じ絵を複数の比率で使うなら、最も制約の強い形(たいていは縦位置)で生成し、残りは サイズ変更 で無理なく合わせてください。

Seed:結果を再現可能にする数字

seedは、画像の出発点となるランダムなノイズを決める整数です。同じプロンプト、同じseed、同じパラメータ、同じモデルであれば、出てくる画像はピクセル単位で一致します。seedが変われば、すべてが変わります。

初心者が最も使いこなせていない値であり、仕事でAIを使う人にとっては最も重要な値でもあります。seedを押さえていなければ、改善を積み重ねることはできません。できるのは、くじを引き直すことだけです。

実際の使い道は3つあります。

ひとつ重要な制約があります。seedはモデルとバージョンに固有だという点です。SDXLのseed 42は、Fluxのseed 42とは似ても似つかない絵を出します。モデルを乗り換えれば、手元のseedはただの数字に戻ります。ですから記録するときは必ず モデル+バージョン+seed をセットにし、seedだけを書き残すことのないようにしてください。

💡 ヒント: よい絵が出たら、その場で一式を保存してください。プロンプト、ネガティブプロンプト、seed、CFG、steps、サンプラー、モデル、比率です。この列を並べただけの表計算ファイルが、画像だけを大量に集めたフォルダよりずっと役に立ちます。記録がなければ、会心の一枚も二度と作れません。

CFG Scale:AIがプロンプトにどれだけ従うか

CFGは Classifier-Free Guidanceの略で、この値は、モデルが自分で描きたいものに対して、あなたの文章をどれだけ重く扱うかを決めます。実質的には従順さのつまみです。

値を下げるとモデルは自由に、創造的になりますが、プロンプトの一部を無視し始めます。上げれば文字どおりに従わせられる一方、色は飽和し、輪郭は硬く、コントラストは過剰になり、いかにも作り物めいた絵になります。俗にいう「焼けた」状態、 overcooked.

CFGの範囲挙動使いどころ
1–3プロンプトをほぼ無視する。予測不能で幻想的な絵になる作風の探索、抽象的な質感づくり
4–6解釈は自由。色はやわらかく、自然な見え方になる写実表現、人物、有機的な情景
7–9従順さと自然さの均衡。標準的な範囲汎用。まずここから始めるとよい
10–14文章に強く従う。色も濃くなるイラスト、グラフィックデザイン、構図を指定したい場合
15+彩度過多、ノイズ、硬い輪郭、形の崩れ役に立つ場面はまれ。ごく特殊な用途のみ

多くの人がつまずく点があります。 新しいモデルは範囲そのものが違うという点です。たとえばFluxは独自のガイダンス尺度を持ち、2〜4が普通の範囲で、そこに7を入れればもう高すぎます。少ないstepsで動くよう蒸留された「turbo」系のモデルでは、CFGは1〜2が標準です。つまり万能の数値は存在せず、 そのモデル に合った数値があるだけです。7が標準だと決めてかかる前に、そのチェックポイントの配布元が示す推奨値を確認してください。

CFGが高すぎるときの症状は、プラスチックのような肌、ネオンじみた色、輪郭のまわりの黒い縁、そして文字や模様のしつこい繰り返しです。低すぎるときの症状は、絵はきれいなのに、頼んだことの半分が入っていないことです。

Stylize:モデル自身の美意識

パラメータの --stylize (または --s)はMidjourney特有の値で、モデルが自分の美的感覚をどれだけ指示に重ねるかを決めます。考え方としてはCFGのほぼ裏返しで、文章への従順さではなく、美的な裁量の大きさを測ります。

範囲は0〜1000で、初期値は100です。実際の効き方は次のとおりです。

混同されやすい兄弟分の値があります。 --chaos (または --c、0〜100)で、こちらが決めるのは 4枚のあいだの振れ幅 であって、1枚ごとの作風ではありません。chaosを高くすると、同じプロンプトから根本的に違う4通りが返ってきます。最初の発想出しには最適ですが、狙いが決まっているときには最悪です。さらに --weirdという値もあり、意図的に奇妙さを加えます。実験向きで、クライアント案件には不向きです。

Midjourney以外のモデルに、stylizeに直接対応する値はありません。似た効果は別の手段で得ます。作風のLoRA、プロンプトに入れる美的なキーワード、CFGの微調整などです。それでも概念を知っておく価値はあります。「モデルにどこまで個性を出させるか」という考え方自体は、形を変えてほぼすべてのツールに現れるからです。

Steps:モデルが何回描き直すか

steps( sampling steps)は、ノイズを取り除く工程の回数です。1ステップごとに、画像は完成形へ少しずつ近づきます。stepsが多いほど処理に時間がかかり、そしてある地点までは細部が増えます。

肝心なのは ある地点まではという部分です。この値の効果は、はっきりと頭打ちになります。10と25の差は歴然、30と60の差はごくわずか、80を超えるとほぼ見分けがつかず、時間と電力を捨てているだけになります。

Steps結果備考
1–8turbo系・蒸留モデルでのみ成立する通常のモデルではぼやけた未完成の絵になる
10–20下描き向き。形は決まるが細部は弱い構図とプロンプトの検証に適する
25–35多くの用途で実用に足る品質標準として推奨される範囲
40–60情報量の多い場面でわずかに向上要素の多い画像でのみ意味がある
80+見て分かる向上はない時間と計算資源の無駄

stepsとサンプラーは直結しています。DPM++ 2M Karras系は収束が速く、25前後で十分な結果になります。一方、Euler a のようなancestral系は完全には収束せず、stepsを増やすほど絵が変わり続けます。これは探索には有利ですが、再現性の面では不利です。一貫性を求めるなら、ancestral系でないサンプラーを選んでください。

作業の進め方としては、最初の探索を低いsteps(15〜20)で回して何十ものプロンプトを手早く試し、勝ち残ったseedだけを30〜40のstepsで作り直すのが実践的です。最初から最高品質で回すのに比べ、時間が大幅に節約できます。

あわせて知っておきたい周辺のパラメータ

主要な5つのほかにも、よく登場し、特定の問題を解決してくれる設定があります。

ツール別のパラメータ対応表

呼び名がプラットフォームごとに違うことが、混乱の大きな原因になっています。対応関係を表にまとめました。

ツールアスペクト比SeedCFG/guidanceStepsStylize
Midjourney--ar 16:9--seed 1234非公開非公開--s 100
Stable Diffusion/ComfyUI幅×高さSeed欄CFG Scalesampling stepsLoRAまたはプロンプトで
Flux幅×高さSeed欄Guidance(2〜4)20〜30が標準LoRAまたはプロンプトで
ChatGPT/GPT Image自然言語で指定非公開非公開非公開プロンプトで
Gemini/Nano Banana自然言語で指定非公開非公開非公開プロンプトで
Leonardo AIプリセット+カスタムSeed欄Guidance Scaleありスタイルのプリセット

傾向ははっきりしています。一般利用者に近いツール(ChatGPT、Gemini)ほど数値を隠し、プラットフォーム側が決めてしまいます。モデルそのものに近いツール(ComfyUI、Automatic1111)ほど、こちらの手に委ねられます。どちらが優れているという話ではなく、目的が違うだけです。ただし、結果を再現することが仕事に含まれるなら、いずれseedとCFGを操作できるツールが必要になります。

組み合わせの実例:目的別のレシピ

パラメータは単独では働きません。以下は実際に試した出発点です。使うモデルに合わせて調整してください。

目的比率CFGSteps備考
写実的な人物写真2:3 または 4:54–630CFGを低めにして肌の質感を守る
商品写真1:17–930–35プロンプトで背景を無地に指定
YouTubeのサムネイル16:99–1225CFGを高めにして色を強く出す
イラスト/コンセプトアート16:9 または 21:97–1030Midjourneyではstylizeを高めに
ロゴ・ブランド1:18–1230指示への忠実さを優先しstylizeを低めに
スマホの壁紙9:166–935アイコン用の余白を残す
プロンプトの下見1:1715方向性の確認だけが目的

この選び方の理屈は一貫しています。写実表現ではCFGを低くします。写真がどう見えるかをモデルはすでに知っており、押しつけると壊れるからです。グラフィックデザインや販促物ではCFGを上げます。指定した要素を、指定した色で、そのまま出したいからです。そしてstepsを上げるのは、細かい要素が画面を奪い合っている場合だけです。

よくある失敗と直し方

生成前のチェックリスト

  1. 比率は、ツールの初期値ではなく画像の 最終的な使い道 から決める。
  2. そのモデルの初期値から始める。値はモデルごとに違うので、必ず確認する。
  3. 低いstepsで4枚だけ生成し、方向性を安く検証する。
  4. いちばんよい1枚を選び、 そのseedを記録する.
  5. seedを固定したまま、狙いに届くまでパラメータを1つずつ調整する。
  6. 仕上げは本番用のsteps(30〜40)で作り直す。
  7. プロンプト、ネガティブ、seed、CFG、steps、サンプラー、モデル、比率を記録する。
  8. 仕上げ処理を行う。アップスケール、トリミング、シャープ化、Web用の圧縮まで。

生成のあと:多くの人が飛ばす工程

AIが出した画像が、そのまま公開できる状態であることはめったにありません。たいていは重いPNGで、モデル本来の解像度のまま、掲載先が求める寸法にも合っていません。この最後の処理こそが、「AIで作った画像」と、サイトやプロフィールでちゃんと機能する画像とを分けています。

手順そのものは短いものです。比率が合わないなら 画像の切り抜き で構図を整え、 サイズ変更で掲載先の寸法ちょうどに合わせ、拡大した場合は シャープ化 で細部を戻します。最後にWebPへ変換し、 圧縮で圧縮します。ページ上部に4 MBのPNGがあれば、どれほど良い絵でもPageSpeedのスコアは落ちるからです。

その画像をブランドの一部として使うなら、作業はさらに続きます。制作物どうしのトーンをそろえるために パレット で配色を抽出し、ブランド用途であれば AIロゴ作成 を使ってください。

AI画像を正しいサイズに整える

パラメータを詰めたら、あとは掲載先の寸法ちょうどに。無料、ブラウザ内で完結、サーバーへの送信は一切ありません。

今すぐ画像をリサイズする

よくある質問

リアルな画像を出すのに最適なCFGの値は?
Stable Diffusion系のモデルでは、写実的な絵づくりに最も自然なのは4〜6の範囲です。値を上げすぎると肌がプラスチックのようになり、コントラストも不自然に強くなります。ガイダンスの尺度が異なるFluxでは、これに相当するのがおおむね2〜4です。標準値を決めつける前に、使っているモデルの推奨値を必ず確認してください。
同じseedなら別のツールでも同じ画像になりますか?
なりません。seedが再現性を持つのは、同じモデル、同じバージョン、同じパラメータの範囲内だけです。SDXLのseed 12345は、FluxやMidjourneyのseed 12345とは何の関係もありません。だからこそ、数字だけでなくモデル名とバージョンをセットで記録する必要があります。seed単体では何の情報にもなりません。
stepsを増やせば必ず画質は上がりますか?
上がりません。効果が大きいのは25〜30あたりまでで、そこから先は急速に頭打ちになります。60を超えると違いはほぼ見分けられず、80以上は処理時間を捨てているだけです。手足の形が崩れる、指定した要素が出ないといった問題の原因はプロンプトかモデルであって、stepsの数ではありません。
Midjourneyのstylizeとchaosの違いは?
stylizeは、モデルが自分の美意識をどれだけ指示に重ねるかを決める値で、1枚ごとの光、色、構図に効きます。chaosは、同時に出てくる4枚のあいだの振れ幅を決める値です。chaosを高くすると、同じプロンプトから大きく異なる4通りの解釈が返ってきます。方向を探る段階では高く、狙いが定まったら低くするのが基本です。
人や物が二重に出てしまうのはなぜですか?
縦横比が極端すぎるか、モデルが学習した解像度を大きく超えている場合によく起こります。モデルは余った空間を埋めようとして、すでに認識している要素を繰り返してしまうのです。正方形か16:9に近い比率、そしてモデル本来の解像度で生成し、そのあとアウトペインティングで広げるか、アップスケールで拡大するのが解決策です。
パラメータ欄のないChatGPTやGeminiではどう調整しますか?
これらのツールは数値の設定を隠し、内部で自動的に決めています。そのため調整はプロンプトの言葉で行います。仕上がりの比率をはっきり指定し、どこまで細部を描き込むかを説明し、指示どおりに描いてほしいのか、解釈を効かせてほしいのかを書き添えてください。厳密な再現性が必要な仕事であれば、ComfyUI、Automatic1111、Leonardo AIなど、seedとCFGを操作できるツールを選ぶべきです。