ChatGPTの画像生成は、もはやおまけの機能ではなく、このツールがいちばん得意なことのひとつになりました。2026年4月以降はネイティブモデルのChatGPT Images 2.0で動いており、同年5月に提供を終えたDALL·Eを完全に置き換えています。そしてこのモデルは、画像AIが長く抱えてきた最大の弱点、つまり絵の中の文字を間違えずに書くことを、ついに解決しました。

これで作れるものの幅が変わりました。見出しが読めるポスター、数字の正しいインフォグラフィック、ブランド名の入った表紙、セリフ入りのマンガのページ、ラベルの入ったパッケージのモックアップ。以前はどれも崩れていたものが、いまはたいてい一発できれいに出ます。

この記事では、最初の1枚を出すところから順にたどります。ChatGPTがいちばん理解しやすいプロンプトの書き方、作り直さずに直す方法、複数の画像で同じキャラクターを保つやり方、無料プランと有料プランの違い、そしていまだに苦手なこと。なお、記事内のサンプルプロンプトは英語で書いてあります。画像モデルは英語での指示にもっとも強く、そのままコピーして使えるようにするためです。

ChatGPTの画像生成は何が変わったのか

2025年までのChatGPTは、DALL·Eという別のシステムを呼び出して画像を作っていました。こちらが書いた指示をChatGPTが内部用のプロンプトに翻訳し、それを別のモデルに渡す仕組みです。途中に、こちらが手を出せない翻訳工程があったため、結果は安定しませんでした。

いまの画像モデルはネイティブで、言語モデルと文脈を共有しています。つまり、文章の質問を理解するのと同じやり方で画像の指示も理解します。「朝7時開店のカフェの告知ポスターを作って」と伝えれば、視覚的な要素をひとつずつ説明しなくても、レイアウトも情報の優先順位も内容も自分で組み立ててくれます。

実務に効いてくる変化は、とくに次の3つです。

💡 知っておきたい点: 無料プランの画像生成の上限は公表されておらず、混雑状況によって変わります。どこかで見かけた数字は、確定した仕様ではなく目安として扱ってください。

最初の1枚を出すまでの手順

流れはこれ以上ないほど単純です。専用の画面も、事前の設定も要りません。

  1. 新しいチャットを開く。 特別なモードを選ぶ必要はありません。頼めばそれで始まります。
  2. 作りたい画像を普通の文章で説明する。 デザイナーに口頭で説明するつもりで、文として書きます。カンマ区切りの単語の羅列は避けてください。あれは別のツールの作法で、ここでは効きが落ちます。
  3. 縦横比を伝える。 「ストーリーズ向けの縦長」「Instagram用の正方形」「16:9の横長」といった具合です。言わなければ、モデルが勝手に決めます。
  4. 生成を待つ。 画像は文章の返答より時間がかかります。要素の詰まったレイアウトならなおさらです。
  5. 同じチャットの中で直しを頼む。 「背景をもっと暗く」「見出しを大きく」「コートの色を赤に」。画像はそのままに、指示した箇所だけが変わります。
  6. フル解像度でダウンロードする。 スクリーンショットではなく、ダウンロードボタンを使ってください。スクショは画質が落ち、サイズもウィンドウ次第になります。

最後の点は見た目より重要です。サムネイルを右クリックして保存し、小さく再圧縮されたファイルを手にしている人はかなり多くいます。

2つのモード:即時と思考

ChatGPT Images 2.0には2つのモードがあり、違いを知っておくと無駄な試行が減ります。

O 即時モード は指示からそのまま生成します。速く、無料を含む全プランで使え、単純な画像なら十分です。ひとつの場面、人物、イラスト、背景といった用途に向きます。

O 思考モード は、描く前にモデルに段取りを立てさせます。物の個数を数え、こちらが出した制約を照合し、レイアウトを整理し、必要なら最新の情報をウェブで調べて画像に反映します。数字の正しいインフォグラフィック、実データの入ったポスター、要素の多い整った構図が出せるのはこのモードです。有料プラン限定です。

使い分けはこうです。場面がひとつだけなら即時モードで足ります。「アイコンをちょうど5個」のような個数の指定、文字の階層、正確さが必要なデータが絡むなら、思考モードの差ははっきり出ます。

ChatGPTに伝わるプロンプトの書き方

Midjourneyのようなツールとの最大の違いがここです。ChatGPTはタグの羅列より、文章を好みます。「35歳の女性、グレーのジャケット、オフィス、85mm、ボケ」でも通じますが、同じ内容を文にしたほうが結果は良くなります。

見た目より先に、用途から書く

何に使うかを伝えるだけで、結果は丸ごと変わります。「12日の写真ワークショップの告知ポスター」と書けば、「カメラと文字が入った画像」と書くよりずっと使えるものが出てきます。モデルは用途をもとに、情報の優先順位も余白の取り方も作風も決めています。

入れたい文字は、そのまま引用符でくくる

画像に文字を入れたいときは、その文字をそのまま引用符でくくって書きます。見出しは「モーニング」、小見出しは「毎週土曜 8:00〜11:00」といった具合です。くくらないと、モデルが言い換えたり別の文言を作ったりします。あわせて、それぞれの文字をどこに置くかも指定してください。上、下、右下、というように。

作風より先に、構造を説明する

効く順番は、何がどこにあるかを先に、どう見えるかを後に、です。「等幅の3カラム。各カラムの上にアイコン、その下に見出し、いちばん下に短い一文。ベージュの背景にサンセリフの書体で、要素を絞ったデザイン」。構造を先に書くと、やり直しが目に見えて減ります。

入れたくないものは、はっきり書く

ChatGPTにはネガティブプロンプトの欄がありません。制約は指示文の中に書き込むことになり、否定形より肯定形のほうがよく効きます。「文字なし」より「見出し以外に文字を入れない、すっきりした構図」のほうが伝わります。

書き直さず、直しを重ねる

会話形式であることの最大の利点がこれです。うまくいかなかったときにプロンプトを一から書き直してはいけません。直しを頼むのです。「ほかはそのままで、背景だけ紺色に」と言えば、うまくいっていた部分は残ります。全文を書き直すと、前とは無関係な画像が新しく生成されます。

💡 近道: 生成の前に、プロンプトの改善をChatGPT自身に頼んでみてください。「まだ生成しないで、この依頼を詳しい画像プロンプトに書き直して」と伝えると、自分では思いつかなかった要素が出てきます。

縦横比と解像度:何をどう頼むか

モデルは超横長から超縦長まで幅広い比率を受け付け、最大2Kまで生成します。生成前に比率を決めておけば、あとから切り抜かずに済みます。あとからの切り抜きは、必ず構図を削ります。

使い道指定のしかた比率
Instagramのフィード正方形1:1
縦長のフィード投稿フィード向けの縦長4:5
ストーリーズ・リールストーリーズ向けの縦長9:16
YouTubeのサムネイルワイドの横長16:9
サイトのバナー横に広いパノラマ3:1
電子書籍の表紙書籍表紙向けの縦長2:3
デスクトップの壁紙ワイドの横長16:9

1920×1080のように解像度が決まっている場合は、まず正しい比率で生成し、あとから サイズ変更で合わせてください。プロンプトの中でピクセル数を指定しても、そのとおりになることはまれです。

修正のしかた:効く言い方

生成専用のツールに対してChatGPTが抜きん出ているのが、この修正の工程です。マスクもレイヤーも選択範囲も要りません。言葉で説明するだけです。

特定の要素だけ変える

「構図はそのまま、壁の色だけセージグリーンに」。変えてほしくない部分をはっきり書くほど、モデルは余計なところに手を出しません。「そのまま」という一語が、ここでは驚くほど働きます。

物を足す・消す

「右隅の観葉植物を消して、壁は無地に」。輪郭のはっきりした物なら問題なく消えます。背景の質感が細かい場所を消すと、跡が残ることがあります。その場合は修正で粘るより、作り直したほうが早く決まります。

場面を保ったまま作風だけ変える

「構図も要素もそのままで、水彩画のタッチに」。気に入った構図を崩さずに、表現だけを比べたいときに便利です。

自分の画像を渡して直す

写真をアップロードして、背景の差し替え、光の調整、イラスト化、バリエーション作成などを頼めます。ただし返ってくるのは、元画像をピクセル単位で編集したものではなく、元画像をもとに新しく生成された画像である点は覚えておいてください。

画角を広げる

「この画像を横長に広げて、左右の風景を自然に続けて」。これは会話形式で行う アウトペイントにあたり、縦長の画像をバナーに作り替えたいという定番の場面をそのまま解決します。

複数の画像で同じキャラクターを保つ

画像AIでもっとも難しかった課題ですが、いまはかなり扱いやすくなりました。手軽な順に3つ紹介します。

同じチャットを続ける。 いちばん簡単で、日々の作業ではいちばん効きます。キャラクターを一度生成したら、説明し直さずに次の場面を頼みます。「同じキャラクターがカフェに座っているところを」と伝えるだけです。モデルが会話の文脈を引き継ぎ、特徴を保ってくれます。

変えない特徴を文章で固定する。 髪、目、決まった服、目印になる小物といった要素を短くまとめ、その一字一句を毎回そのまま繰り返します。言い換えは禁物です。「ベージュのコート」と「砂色のロングコート」では、別の服が出てきます。

先に設定シートを作らせる。 同じ顔を複数の角度と表情で並べたキャラクター設定シートを作り、それを以降の生成の参照として渡します。手間はかかりますが、いちばんぶれません。長く続くシリーズではとくに有効です。

商品やブランドの世界観にも同じ理屈が当てはまります。説明が固定されているほど、結果は安定します。

無料と有料で実際に何が違うのか

画像生成は無料を含むすべてのプランで使えます。違うのは枚数、速度、そして思考モードを使えるかどうかです。

項目無料プラン有料プラン
画像生成使える(即時モードのみ)使える(即時・思考の両方)
枚数制限あり(上限は非公表)大幅に多い
速度遅め。順番待ちが発生します混雑時も優先されます
生成中のウェブ検索なしあり(思考モード)
複雑なレイアウト・インフォグラフィック仕上がりにばらつきかなり安定
一貫したシリーズ画像限定的対応

壁紙を1枚、投稿用のイラストを1枚、記事に添える画像を1枚。こうした個人的な用途なら無料プランで足ります。レイアウトと文字を含む制作を日常的に、しかも量をこなすとなると、差はすぐ表に出ます。契約前にほかの選択肢と比べたいなら、 画像生成AIのおすすめ比較 が主要なサービスを並べていますし、 Geminiで画像を作るガイド が最有力の対抗馬を扱っています。

ChatGPTがいまだに苦手なこと

できないことを先に知っておくと、時間を無駄にせずに済みます。以下はプロンプトの書き方の問題ではなく、ツール側の制約です。

とくに損をする7つの失敗

  1. タグの羅列で書く。 カンマ区切りの単語列は別のツールの作法です。ここでは文章のほうが結果が出ます。
  2. 縦横比を伝えない。 指定しなければモデルが決めます。そしてたいてい、用途に合わない形になります。
  3. 毎回プロンプトを書き直す。 うまくいっていた部分まで失います。直したい箇所だけを頼んでください。
  4. 入れたい文字をそのまま地の文に混ぜる。 引用符も配置指定もないと、モデルは言い換えるか、好きな場所に置きます。
  5. スクリーンショットで保存する。 解像度が落ち、再圧縮もかかります。ダウンロードを使ってください。
  6. 一度に全部を頼む。 10個の条件を同時に出すと、2つ3つは崩れます。土台を作ってから、段階的に直すほうが確実です。
  7. 最適化せずにそのまま公開する。 2KのPNGは数メガバイトになり、どんなページでも表示速度を落とします。

生成したあとにやること

最後の項目は詳しく見ておく価値があります。多くの人がつまずくのはここだからです。ChatGPTから出てきた画像は、見るには十分でも、公開するには整っていません。

適した形式に変換する。 PNGは透過に強く、ウェブ上の写真には向きません。サイト用なら、WebPにすると見た目を変えずに容量が半分ほどになります。人に送るだけならJPGで十分です。 変換 ならブラウザ上でそのまま変換できますし、 画像形式の使い分けガイド が選び方の助けになります。

容量を落とす。 2Kの画像は5MBを超えることもあります。 圧縮 を使えば、見た目を保ったまま大きく削れます。それでも重い場合は、 画像をMBからKBに減らす手順 が細かい部分まで解説しています。

必要なら被写体だけを切り出す。 色付きの背景に載せるロゴ、商品、パーツであれば、 背景を削除 して透過PNGで保存する工程が必要です。

解像度と画角を整える。 必要より小さく出てしまったときは、 画質を落とさずに解像度を上げる方法があります。比率が合わなかった場合は、 画像の切り抜き のほうが引き伸ばすより情報を残せます。

配色を引き継ぐ。 別々のチャットで作った画像の見た目をそろえたいときは、いちばん良かった1枚から 色を抽出 して、その色を次のプロンプトで指定してください。

💡 うまくいく順番: フル解像度でダウンロード → 切り抜き・リサイズ → 形式を変換 → 最後に圧縮。リサイズより先に圧縮すると、画質を無駄に捨てることになります。

そのまま使える3つのプロンプト例

最後に、ChatGPTがいちばん活かせる書き方の例を3つ挙げます。どれも用途、入れる文字、比率を明記している点に注目してください。プロンプトは英語で書いてあります。そのままコピーして使えます。

Create a vertical promotional poster for a photography workshop. The title should read "Natural Light" in large type at the top, and below it, smaller, "Saturday, July 12 — 2:00 PM to 6:00 PM". Earthy background tone with a thin-line camera silhouette. Minimalist style, sans-serif typography, plenty of empty space. Vertical format for stories.
Generate a horizontal infographic with three equal columns explaining the stages of a process. Each column has a simple icon at the top, a short title and one supporting sentence. The titles are "Collect", "Analyze" and "Publish". Palette of navy blue, white and one orange accent. Clean editorial style, no shadows. Widescreen format.
Create a square product photo of a matte white cream jar on light stone, with fresh green leaves around it and a soft beige background. Diffused natural light coming from the left, frontal close-up, clean skincare aesthetic. No text anywhere in the image.

生成前のチェックリスト

公開できる状態に仕上げる

2Kで生成した画像は簡単に5MBを超えます。見た目を保ったまま、ブラウザ上で容量を落としましょう。

画像を圧縮

よくある質問

無料版のChatGPTでも画像を作れますか?
作れます。画像生成は無料プランを含むすべてのプランで、即時モードとして使えます。違いが出るのは生成できる枚数、混雑時の速度、そして有料プラン限定の思考モードを使えるかどうかです。無料プランの正確な枚数はOpenAIが公表しておらず、混雑状況によっても変わります。どこかで見かけた具体的な数字は目安として受け取ってください。
ChatGPTはいまもDALL·Eを使っているのですか?
使っていません。2026年4月以降、画像生成はChatGPTに統合されたネイティブモデル、ChatGPT Images 2.0で動いています。DALL·E 2とDALL·E 3は2026年5月に提供を終えました。実用面での差は小さくありません。画像モデルが言語モデルと文脈を共有するようになったため、以前のように途中で指示を別のプロンプトへ翻訳する工程がなくなり、仕上がりのばらつきが大きく減りました。
画像の中の文字が正しく出ないのはなぜですか?
原因はたいてい2つです。ひとつは、入れたい文字を引用符でくくっていないこと。くくらないと、モデルはその語をテーマとして受け取り、言い換えてしまうことがあります。もうひとつは文字量です。長く詰まった文章は、短い見出しや一文よりも崩れやすいままです。どうしても正確な文字が必要で直らない場合は、文字なしで生成し、あとから編集ソフトで文字を載せるのがいちばん確実です。
生成できる最大解像度はどのくらいですか?
最大2Kまでで、超横長から超縦長まで幅広い比率に対応しています。SNS、サイト、プレゼン資料、サムネイルといったデジタル用途には十分です。大判印刷や4Kモニターの壁紙に使うなら、生成後に拡大する必要があります。線が整理された、細部の少ない画像であればきれいに拡大できます。
生成した画像を商用利用できますか?
OpenAIの利用規約は、自分で生成した画像の商用利用を認めています。ただし規約は変わりますし、プランや国によっても扱いが違います。さらに、商用利用できることと法的に保護されることは別物です。機械だけで作られた成果物は、国によっては著作権登録に制限がかかります。クライアント向けの制作物や販売する商品に使う前に、その時点の規約を確認し、登録商標・ライセンスされたキャラクター・実在の人物を含む指示は避けてください。
ChatGPTに背景が透明な画像を作らせるには?
はっきり指示しても、実際には透明ではなく塗りつぶした背景で返ってくることがほとんどです。近道は、切り抜きやすい真っ白な背景で作らせて、あとから背景を消して透過PNGで保存することです。この作業は数秒で終わり、モデルに粘るより仕上がりも整います。粘ると、透明を模した市松模様を「描いた」画像が返ってくることが多いからです。