Criar imagens no ChatGPT deixou de ser um recurso paralelo e virou uma das coisas que a ferramenta faz de melhor. Desde abril de 2026, a geração de imagens roda no ChatGPT Images 2.0, um modelo nativo que substituiu de vez o DALL·E — aposentado em maio do mesmo ano — e que acertou o problema mais persistente de toda IA de imagem: escrever texto dentro da figura sem errar as letras.

Isso muda o tipo de coisa que dá para fazer. Cartaz com título legível, infográfico com números corretos, capa com o nome da marca, página de história em quadrinhos com falas, mockup de embalagem com rótulo — tudo isso saía torto antes e agora sai limpo na maioria das tentativas.

Este guia cobre o caminho completo: como gerar a primeira imagem, como escrever o prompt do jeito que o ChatGPT entende melhor, como editar sem regenerar tudo, como manter o mesmo personagem entre imagens, o que muda entre o plano gratuito e o pago, e o que a ferramenta ainda não faz bem.

O que mudou na geração de imagens do ChatGPT

Até 2025, o ChatGPT gerava imagens acionando o DALL·E como um sistema separado: você escrevia, ele traduzia seu pedido em um prompt interno e mandava para outro modelo. O resultado era irregular, porque havia uma tradução no meio do caminho que você não controlava.

Hoje o modelo de imagem é nativo e compartilha contexto com o modelo de linguagem. Na prática isso significa que ele entende o pedido da mesma forma que entende uma pergunta de texto: se você disser "faça um cartaz para uma cafeteria que abre às 7h em Porto Alegre", ele não precisa que você descreva cada elemento visual — ele deduz layout, hierarquia e conteúdo.

Três consequências práticas importam mais que as outras:

💡 Vale saber: os limites de geração de imagem no plano gratuito não são divulgados oficialmente e mudam conforme a demanda da plataforma. Trate qualquer número que você vir por aí como estimativa, não como regra fixa.

Como gerar sua primeira imagem, passo a passo

O fluxo é o mais simples possível — não existe painel separado nem configuração prévia obrigatória.

  1. Abra uma conversa nova. Não é necessário selecionar nenhum modo especial; basta pedir.
  2. Descreva a imagem em linguagem natural. Escreva como se estivesse explicando a um designer, em frases completas. Não use lista de palavras separadas por vírgula: esse formato é de outras ferramentas e aqui rende menos.
  3. Diga a proporção. "Formato vertical para stories", "quadrado para Instagram", "horizontal 16:9". Se você não disser, ele escolhe sozinho.
  4. Aguarde a geração. Imagens levam mais tempo que respostas de texto, especialmente as com layout denso.
  5. Peça ajustes na própria conversa. "Deixe o fundo mais escuro", "aumente o título", "troque a cor do casaco para vermelho". Ele mantém a imagem e altera só o que você pediu.
  6. Baixe em resolução cheia. Use o botão de download, e não captura de tela — a captura perde qualidade e vem no tamanho da sua janela.

Esse último ponto é mais importante do que parece. Muita gente salva a imagem clicando com o botão direito na miniatura e acaba com um arquivo pequeno e recomprimido.

Os dois modos: instantâneo e raciocínio

O ChatGPT Images 2.0 opera em dois modos, e entender a diferença evita frustração.

O modo instantâneo gera direto a partir do seu pedido. É rápido, disponível em todos os planos incluindo o gratuito, e cobre bem imagens simples: uma cena, um retrato, uma ilustração, um fundo.

O modo com raciocínio — o "thinking" — faz o modelo planejar antes de desenhar: ele verifica quantidade de objetos, confere as restrições que você pediu, organiza o layout e, quando necessário, pesquisa na web para trazer informação atualizada para dentro da imagem. É esse modo que entrega infográfico correto, cartaz com dados reais e composição com muitos elementos alinhados. Está restrito aos planos pagos.

Na prática: se o seu pedido tem uma cena só, o modo instantâneo basta. Se tem contagem ("exatamente cinco ícones"), hierarquia de texto ou dados que precisam estar certos, o raciocínio faz diferença real.

Como escrever prompts que o ChatGPT entende melhor

Aqui está a maior diferença entre o ChatGPT e ferramentas como Midjourney: ele prefere prosa a lista de tags. Escrever "mulher, 35 anos, blazer cinza, escritório, 85mm, bokeh" funciona, mas rende menos do que a mesma informação em frases.

Comece pela função da imagem, não pela descrição

Dizer para que serve muda o resultado inteiro. "Um cartaz de divulgação para o workshop de fotografia do dia 12" produz algo muito mais utilizável do que "uma imagem com uma câmera e um texto". O modelo usa a finalidade para decidir hierarquia, espaço e estilo.

Escreva o texto exato entre aspas

Quando a imagem precisa conter palavras, escreva-as literalmente e entre aspas: o título "Café da Manhã", o subtítulo "todos os sábados, das 8h às 11h". Sem aspas, o modelo pode parafrasear ou inventar. E diga onde cada texto fica: topo, rodapé, canto inferior direito.

Descreva a estrutura antes do estilo

A ordem que funciona é: o que aparece e onde → depois como parece. "Três colunas iguais, ícone no topo de cada uma, título abaixo e um parágrafo curto embaixo; estilo minimalista com fundo bege e tipografia sem serifa." Estrutura primeiro dá muito menos retrabalho.

Seja explícito sobre o que não quer

O ChatGPT não tem campo de prompt negativo. A restrição entra dentro do próprio pedido, e funciona melhor em forma afirmativa: "composição limpa, sem nenhum texto além do título" rende mais do que "sem texto".

Itere em vez de reescrever

É o maior diferencial da interface conversacional. Não reescreva o prompt do zero quando algo sai errado: peça a correção. "Mantenha tudo, mas troque o fundo para azul-marinho" preserva o que já estava bom. Reescrever o prompt inteiro gera uma imagem nova sem relação com a anterior.

💡 Atalho útil: peça ao próprio ChatGPT para melhorar seu prompt antes de gerar. "Reescreva este pedido como um prompt detalhado de imagem, sem gerar nada ainda" costuma revelar detalhes que você não tinha pensado.

Proporção e resolução: o que pedir

O modelo aceita uma faixa ampla de formatos, de ultra-largos a ultra-altos, e gera em até 2K. Definir a proporção antes de gerar evita recorte depois — e recorte depois sempre custa composição.

DestinoComo pedirProporção
Feed do Instagramformato quadrado1:1
Feed vertical / retratoformato retrato para feed4:5
Stories e Reelsformato vertical de stories9:16
Thumbnail de YouTubeformato horizontal widescreen16:9
Banner de siteformato panorâmico largo3:1
Capa de e-bookformato vertical de capa de livro2:3
Wallpaper de desktopformato horizontal widescreen16:9

Se você precisa de uma resolução específica — 1920 por 1080, por exemplo — gere na proporção certa e ajuste depois com o redimensionador de imagem. Pedir dimensões exatas em pixels dentro do prompt raramente é respeitado ao pé da letra.

Editar imagens: os comandos que funcionam

Editar é onde o ChatGPT se destaca em relação a ferramentas de geração pura. Você não precisa de máscara, camada nem seleção — descreve em palavras.

Alterar um elemento específico

"Mantenha a composição e troque apenas a cor da parede para verde-sálvia." Quanto mais explícito você for sobre o que deve permanecer igual, menos o modelo mexe no resto. A palavra "mantenha" faz um trabalho surpreendentemente grande aqui.

Adicionar ou remover objetos

"Remova a planta do canto direito e deixe a parede lisa." Funciona bem com objetos claramente delimitados. Remoções em áreas com muita textura de fundo às vezes deixam marcas — nesse caso, gerar de novo costuma sair melhor do que insistir na edição.

Trocar o estilo mantendo a cena

"Mesma composição, mesmos elementos, mas em estilo aquarela." É útil para testar linguagens visuais diferentes sem perder o enquadramento que você já aprovou.

Editar a partir de uma imagem sua

Você pode enviar uma foto e pedir alterações: mudar o fundo, ajustar a iluminação, transformar em ilustração, criar variações. Vale lembrar que o resultado é uma imagem nova gerada a partir da sua, não uma edição pixel a pixel do original.

Expandir o enquadramento

"Expanda esta imagem para o formato horizontal, continuando o cenário naturalmente para os lados." É o equivalente conversacional do outpainting, e resolve o caso clássico de ter uma imagem vertical que precisa virar banner.

Como manter o mesmo personagem em várias imagens

Esse era o problema mais difícil das IAs de imagem e ficou bem mais tratável. Três abordagens, da mais simples para a mais confiável.

Continuar na mesma conversa. É o método mais fácil e o mais eficaz no dia a dia. Depois de gerar o personagem, peça a próxima cena sem redescrevê-lo: "agora mostre o mesmo personagem sentado em um café". O modelo carrega o contexto da conversa e mantém os traços.

Descrever traços fixos por escrito. Monte uma descrição curta e imutável — cabelo, olhos, roupa característica, acessório marcante — e repita exatamente as mesmas palavras em todos os pedidos. Sinônimos atrapalham: "casaco bege" e "sobretudo cor de areia" produzem peças diferentes.

Pedir uma folha de referência primeiro. Gere uma ficha de personagem com o mesmo rosto em vários ângulos e expressões, e use essa imagem como referência nas gerações seguintes. É o caminho mais trabalhoso e o mais consistente, especialmente para séries longas.

Vale a mesma lógica para produtos e para identidade de marca: quanto mais fixa a descrição, mais estável o resultado.

Gratuito ou pago: o que realmente muda

A geração de imagens está disponível em todos os planos, inclusive no gratuito. O que varia é volume, velocidade e acesso ao modo com raciocínio.

AspectoPlano gratuitoPlanos pagos
Geração de imagemDisponível, modo instantâneoDisponível, instantâneo e raciocínio
VolumeLimitado, cota não divulgadaBem mais alto
VelocidadeMais lenta, sujeita a filaPrioridade em horários de pico
Pesquisa na web durante a geraçãoNãoSim, no modo raciocínio
Layouts complexos e infográficosResultado irregularBem mais confiável
Conjuntos de imagens consistentesLimitadoSim

Para uso pessoal ocasional — um wallpaper, uma ilustração para um post, uma imagem de apoio — o plano gratuito resolve. Para trabalho recorrente com layout, texto e volume, a diferença aparece rápido. Se você quer comparar com outras opções antes de assinar, o guia das melhores IAs para criar imagens coloca os principais nomes lado a lado, e o guia do Gemini para criar imagens cobre a principal alternativa.

O que o ChatGPT ainda não faz bem

Saber as limitações economiza tempo. Nenhuma delas é defeito de prompt: são limites da ferramenta.

Sete erros que mais atrapalham

  1. Escrever em formato de tags. Lista de palavras separadas por vírgula é a linguagem de outras ferramentas. Aqui, prosa rende mais.
  2. Não dizer a proporção. Sem indicação, o modelo escolhe — e quase sempre escolhe o formato errado para o seu uso.
  3. Reescrever o prompt a cada tentativa. Você perde o que já tinha acertado. Peça correções pontuais.
  4. Deixar o texto solto no pedido. Sem aspas e sem posição, o modelo parafraseia ou coloca onde quiser.
  5. Salvar por captura de tela. Perde resolução e adiciona recompressão. Use o download.
  6. Pedir tudo de uma vez. Prompts com dez exigências simultâneas costumam falhar em duas ou três. Gere a base e ajuste em etapas.
  7. Publicar direto sem otimizar. Uma imagem de 2K em PNG pesa vários megabytes e derruba o carregamento de qualquer página.

O que fazer com a imagem depois de gerar

Esse último ponto merece detalhe, porque é onde a maioria erra. A imagem que sai do ChatGPT está pronta para ser vista, não para ser publicada.

Converta para o formato certo. PNG é ótimo para transparência e péssimo para foto na web. Para site, WebP costuma reduzir o peso pela metade sem diferença visível; para envio comum, JPG resolve. O conversor de imagem faz a troca direto no navegador, e o guia de formatos de imagem ajuda a escolher.

Reduza o peso. Uma imagem em 2K pode passar de 5 MB. O compressor de imagem corta boa parte disso sem perda visível — e se o arquivo estiver realmente grande, o passo a passo de como reduzir imagem de MB para KB cobre os detalhes.

Isole o objeto quando precisar. Para logos, produtos e elementos que vão sobre fundo colorido, remover o fundo e salvar em PNG transparente é o passo que falta.

Ajuste resolução e enquadramento. Se a imagem saiu menor que o necessário, dá para aumentar a resolução sem perder qualidade. Se saiu na proporção errada, recortar preserva mais do que esticar.

Aproveite a paleta. Para manter coerência visual entre imagens geradas em sessões diferentes, extraia as cores da que ficou melhor e cite esses tons nos próximos prompts.

💡 Ordem que funciona: baixe em resolução cheia → recorte ou redimensione → converta o formato → comprima por último. Comprimir antes de redimensionar desperdiça qualidade.

Três exemplos de pedidos completos

Para fechar, três pedidos escritos do jeito que o ChatGPT aproveita melhor — repare que todos dizem a finalidade, o texto exato e a proporção.

Crie um cartaz vertical de divulgação para um workshop de fotografia. O título deve ser "Luz Natural" em letras grandes no topo, e abaixo, menor, "sábado, 12 de julho — 14h às 18h". Fundo em tom terroso com uma silhueta de câmera em traço fino. Estilo minimalista, tipografia sem serifa, muito espaço vazio. Formato vertical para stories.
Gere um infográfico horizontal com três colunas iguais explicando as etapas de um processo. Cada coluna tem um ícone simples no topo, um título curto e uma frase de apoio. Os títulos são "Coletar", "Analisar" e "Publicar". Paleta em azul-marinho, branco e um tom de laranja para destaque. Estilo editorial limpo, sem sombras. Formato widescreen.
Crie uma foto de produto quadrada de um pote de creme branco fosco sobre pedra clara, com folhas verdes frescas ao redor e fundo bege suave. Luz natural difusa vindo da esquerda, close frontal, estética clean de skincare. Sem nenhum texto na imagem.

Checklist antes de gerar

Deixe suas imagens prontas para publicar

Imagens geradas em 2K passam facilmente de 5 MB. Reduza o peso sem perder qualidade visível, direto no navegador.

Comprimir imagem

Perguntas frequentes

Dá para criar imagens no ChatGPT gratuito?
Sim. A geração de imagens está disponível em todos os planos, incluindo o gratuito, no modo instantâneo. O que muda é o volume permitido, a velocidade em horários de pico e o acesso ao modo com raciocínio, restrito aos planos pagos. A OpenAI não divulga o número exato de imagens do plano gratuito, e esse limite varia conforme a demanda da plataforma, então qualquer número específico que você encontrar por aí deve ser tratado como estimativa.
O ChatGPT ainda usa o DALL·E?
Não. Desde abril de 2026, a geração de imagens roda no ChatGPT Images 2.0, um modelo nativo integrado ao próprio ChatGPT. O DALL·E 2 e o DALL·E 3 foram aposentados em maio de 2026. A diferença prática é grande: como o modelo de imagem compartilha contexto com o modelo de linguagem, ele entende o pedido diretamente, sem a etapa intermediária de tradução que existia antes e que deixava o resultado irregular.
Por que o texto da minha imagem saiu errado?
Duas causas cobrem quase todos os casos. A primeira é não ter escrito o texto entre aspas: sem isso o modelo interpreta a palavra como tema e pode parafrasear. A segunda é excesso de texto — parágrafos longos e densos ainda têm mais chance de erro do que títulos e frases curtas. Se o texto for essencial e continuar saindo errado, o caminho mais confiável é gerar a imagem sem texto e adicionar as palavras depois em um editor.
Qual a resolução máxima das imagens?
O modelo gera em até 2K, com uma faixa ampla de proporções que vai de formatos ultra-largos a ultra-altos. Isso atende bem uso digital: redes sociais, site, apresentação e thumbnail. Para impressão em tamanho grande ou para wallpaper de monitor 4K, é necessário ampliar a imagem depois da geração, o que funciona bem quando a imagem é limpa e pouco detalhada.
Posso usar comercialmente as imagens que eu gerar?
Os termos de uso da OpenAI permitem uso comercial das imagens que você gera, mas as regras podem mudar e variam conforme o plano e o país. Além disso, uso comercial não é o mesmo que proteção legal: em várias jurisdições, obras criadas inteiramente por máquina enfrentam restrições de registro de direitos autorais. Antes de usar em material de cliente ou produto à venda, confira os termos vigentes e evite pedidos que envolvam marcas registradas, personagens licenciados ou pessoas reais.
Como faço para o ChatGPT gerar a imagem com fundo transparente?
Mesmo pedindo explicitamente, o resultado costuma vir com fundo sólido em vez de transparência real. O caminho mais rápido é pedir fundo branco liso, que é o mais fácil de recortar, e criar a transparência depois removendo o fundo e salvando em PNG. Essa etapa leva segundos e dá um resultado mais limpo do que insistir com o modelo, que tende a devolver um fundo quadriculado desenhado imitando transparência.