Crear imágenes en ChatGPT dejó de ser una función paralela y se convirtió en una de las cosas que la herramienta hace mejor. Desde abril de 2026, la generación de imágenes corre en ChatGPT Images 2.0, un modelo nativo que reemplazó definitivamente a DALL·E — retirado en mayo del mismo año — y que resolvió el problema más persistente de toda IA de imagen: escribir texto dentro de la figura sin errar las letras.

Esto cambia el tipo de cosas que se pueden hacer. Cartel con título legible, infografía con números correctos, portada con el nombre de la marca, página de cómic con diálogos, mockup de empaque con etiqueta — todo eso salía torcido antes y ahora sale limpio en la mayoría de los intentos.

Esta guía cubre el camino completo: cómo generar la primera imagen, cómo escribir el prompt de la forma que ChatGPT entiende mejor, cómo editar sin regenerar todo, cómo mantener el mismo personaje entre imágenes, qué cambia entre el plan gratuito y el pago, y lo que la herramienta todavía no hace bien.

Qué cambió en la generación de imágenes de ChatGPT

Hasta 2025, ChatGPT generaba imágenes activando DALL·E como un sistema aparte: escribías, él traducía tu pedido en un prompt interno y lo enviaba a otro modelo. El resultado era irregular, porque había una traducción en el medio que no controlabas.

Hoy el modelo de imagen es nativo y comparte contexto con el modelo de lenguaje. En la práctica esto significa que entiende el pedido de la misma forma que entiende una pregunta de texto: si dices "haz un cartel para una cafetería que abre a las 7h en Porto Alegre", no necesita que describas cada elemento visual — deduce el layout, la jerarquía y el contenido.

Tres consecuencias prácticas importan más que las otras:

💡 Vale saber: los límites de generación de imagen en el plan gratuito no se divulgan oficialmente y cambian según la demanda de la plataforma. Trata cualquier número que veas por ahí como estimación, no como regla fija.

Cómo generar tu primera imagen, paso a paso

El flujo es lo más simple posible — no existe panel aparte ni configuración previa obligatoria.

  1. Abre una conversación nueva. No es necesario seleccionar ningún modo especial; basta con pedirlo.
  2. Describe la imagen en lenguaje natural. Escribe como si estuvieras explicando a un diseñador, en frases completas. No uses lista de palabras separadas por comas: ese formato es de otras herramientas y aquí rinde menos.
  3. Indica la proporción. "Formato vertical para historias", "cuadrado para Instagram", "horizontal 16:9". Si no lo dices, él elige solo.
  4. Espera la generación. Las imágenes toman más tiempo que las respuestas de texto, especialmente las de layout denso.
  5. Pide ajustes en la misma conversación. "Oscurece más el fondo", "agranda el título", "cambia el color del abrigo a rojo". Mantiene la imagen y cambia solo lo que pediste.
  6. Descarga en resolución completa. Usa el botón de descarga, y no captura de pantalla — la captura pierde calidad y sale en el tamaño de tu ventana.

Este último punto es más importante de lo que parece. Mucha gente guarda la imagen haciendo clic derecho en la miniatura y termina con un archivo pequeño y recomprimido.

Los dos modos: instantáneo y razonamiento

ChatGPT Images 2.0 opera en dos modos, y entender la diferencia evita frustración.

El modo instantáneo genera directo a partir de tu pedido. Es rápido, está disponible en todos los planes incluido el gratuito, y cubre bien imágenes simples: una escena, un retrato, una ilustración, un fondo.

El modo con razonamiento — el "thinking" — hace que el modelo planee antes de dibujar: verifica la cantidad de objetos, revisa las restricciones que pediste, organiza el layout y, cuando es necesario, busca en la web para traer información actualizada dentro de la imagen. Es este modo el que entrega infografía correcta, cartel con datos reales y composición con muchos elementos alineados. Está restringido a los planes pagos.

En la práctica: si tu pedido tiene una sola escena, el modo instantáneo basta. Si tiene conteo ("exactamente cinco íconos"), jerarquía de texto o datos que necesitan estar correctos, el razonamiento marca una diferencia real.

Cómo escribir prompts que ChatGPT entiende mejor

Aquí está la mayor diferencia entre ChatGPT y herramientas como Midjourney: prefiere prosa a lista de etiquetas. Escribir "mujer, 35 años, blazer gris, oficina, 85mm, bokeh" funciona, pero rinde menos que la misma información en frases.

Empieza por la función de la imagen, no por la descripción

Decir para qué sirve cambia todo el resultado. "Un cartel de promoción para el taller de fotografía del día 12" produce algo mucho más utilizable que "una imagen con una cámara y un texto". El modelo usa la finalidad para decidir jerarquía, espacio y estilo.

Escribe el texto exacto entre comillas

Cuando la imagen necesita contener palabras, escríbelas literalmente y entre comillas: el título "Desayuno", el subtítulo "todos los sábados, de 8h a 11h". Sin comillas, el modelo puede parafrasear o inventar. Y di dónde va cada texto: arriba, pie de página, esquina inferior derecha.

Describe la estructura antes que el estilo

El orden que funciona es: qué aparece y dónde → luego cómo se ve. "Tres columnas iguales, ícono arriba de cada una, título debajo y un párrafo corto abajo; estilo minimalista con fondo beige y tipografía sin serifas." La estructura primero da mucho menos retrabajo.

Sé explícito sobre lo que no quieres

ChatGPT no tiene campo de prompt negativo. La restricción entra dentro del propio pedido, y funciona mejor en forma afirmativa: "composición limpia, sin ningún texto además del título" rinde más que "sin texto".

Itera en vez de reescribir

Es el mayor diferencial de la interfaz conversacional. No reescribas el prompt desde cero cuando algo sale mal: pide la corrección. "Mantén todo, pero cambia el fondo a azul marino" preserva lo que ya estaba bien. Reescribir el prompt entero genera una imagen nueva sin relación con la anterior.

💡 Atajo útil: pídele al propio ChatGPT que mejore tu prompt antes de generar. "Reescribe este pedido como un prompt detallado de imagen, sin generar nada todavía" suele revelar detalles en los que no habías pensado.

Proporción y resolución: qué pedir

El modelo acepta una amplia gama de formatos, de ultra anchos a ultra altos, y genera hasta 2K. Definir la proporción antes de generar evita el recorte después — y el recorte después siempre cuesta composición.

DestinoCómo pedirloProporción
Feed de Instagramformato cuadrado1:1
Feed vertical / retratoformato retrato para feed4:5
Historias y Reelsformato vertical de historias9:16
Miniatura de YouTubeformato horizontal widescreen16:9
Banner de sitio webformato panorámico ancho3:1
Portada de e-bookformato vertical de portada de libro2:3
Fondo de pantalla de escritorioformato horizontal widescreen16:9

Si necesitas una resolución específica — 1920 por 1080, por ejemplo — genera en la proporción correcta y ajusta después con el redimensionador de imagen. Pedir dimensiones exactas en píxeles dentro del prompt rara vez se respeta al pie de la letra.

Editar imágenes: los comandos que funcionan

Editar es donde ChatGPT se destaca frente a herramientas de generación pura. No necesitas máscara, capa ni selección — describes con palabras.

Alterar un elemento específico

"Mantén la composición y cambia solo el color de la pared a verde salvia." Cuanto más explícito seas sobre lo que debe permanecer igual, menos toca el modelo el resto. La palabra "mantén" hace un trabajo sorprendentemente grande aquí.

Agregar o quitar objetos

"Quita la planta de la esquina derecha y deja la pared lisa." Funciona bien con objetos claramente delimitados. Las eliminaciones en áreas con mucha textura de fondo a veces dejan marcas — en ese caso, generar de nuevo suele salir mejor que insistir con la edición.

Cambiar el estilo manteniendo la escena

"Misma composición, mismos elementos, pero en estilo acuarela." Es útil para probar lenguajes visuales distintos sin perder el encuadre que ya aprobaste.

Editar a partir de una imagen tuya

Puedes enviar una foto y pedir cambios: cambiar el fondo, ajustar la iluminación, transformar en ilustración, crear variaciones. Vale recordar que el resultado es una imagen nueva generada a partir de la tuya, no una edición pixel a pixel del original.

Expandir el encuadre

"Expande esta imagen al formato horizontal, continuando el escenario naturalmente hacia los lados." Es el equivalente conversacional del outpainting, y resuelve el caso clásico de tener una imagen vertical que necesita convertirse en banner.

Cómo mantener el mismo personaje en varias imágenes

Este era el problema más difícil de las IAs de imagen y se volvió bastante más manejable. Tres enfoques, del más simple al más confiable.

Continuar en la misma conversación. Es el método más fácil y el más eficaz en el día a día. Después de generar el personaje, pide la siguiente escena sin redescribirlo: "ahora muestra al mismo personaje sentado en un café". El modelo carga el contexto de la conversación y mantiene los rasgos.

Describir rasgos fijos por escrito. Arma una descripción corta e inmutable — cabello, ojos, ropa característica, accesorio distintivo — y repite exactamente las mismas palabras en todos los pedidos. Los sinónimos estorban: "abrigo beige" y "sobretodo color arena" producen piezas distintas.

Pedir una hoja de referencia primero. Genera una ficha de personaje con el mismo rostro en varios ángulos y expresiones, y usa esa imagen como referencia en las generaciones siguientes. Es el camino más laborioso y el más consistente, especialmente para series largas.

Vale la misma lógica para productos y para identidad de marca: cuanto más fija la descripción, más estable el resultado.

Gratuito o pago: qué cambia realmente

La generación de imágenes está disponible en todos los planes, incluido el gratuito. Lo que varía es el volumen, la velocidad y el acceso al modo con razonamiento.

AspectoPlan gratuitoPlanes pagos
Generación de imagenDisponible, modo instantáneoDisponible, instantáneo y razonamiento
VolumenLimitado, cuota no divulgadaBastante más alto
VelocidadMás lenta, sujeta a colaPrioridad en horarios pico
Búsqueda en la web durante la generaciónNoSí, en modo razonamiento
Layouts complejos e infografíasResultado irregularBastante más confiable
Conjuntos de imágenes consistentesLimitado

Para uso personal ocasional — un fondo de pantalla, una ilustración para un post, una imagen de apoyo — el plan gratuito resuelve. Para trabajo recurrente con layout, texto y volumen, la diferencia aparece rápido. Si quieres comparar con otras opciones antes de suscribirte, la guía de las mejores IAs para crear imágenes pone los principales nombres lado a lado, y la guía de Gemini para crear imágenes cubre la principal alternativa.

Lo que ChatGPT todavía no hace bien

Conocer las limitaciones ahorra tiempo. Ninguna de ellas es defecto de prompt: son límites de la herramienta.

Siete errores que más estorban

  1. Escribir en formato de etiquetas. Lista de palabras separadas por comas es el lenguaje de otras herramientas. Aquí, la prosa rinde más.
  2. No indicar la proporción. Sin indicación, el modelo elige — y casi siempre elige el formato equivocado para tu uso.
  3. Reescribir el prompt en cada intento. Pierdes lo que ya habías logrado. Pide correcciones puntuales.
  4. Dejar el texto suelto en el pedido. Sin comillas y sin posición, el modelo parafrasea o lo coloca donde quiera.
  5. Guardar por captura de pantalla. Pierde resolución y agrega recompresión. Usa la descarga.
  6. Pedir todo de una vez. Prompts con diez exigencias simultáneas suelen fallar en dos o tres. Genera la base y ajusta por etapas.
  7. Publicar directo sin optimizar. Una imagen de 2K en PNG pesa varios megabytes y frena la carga de cualquier página.

Qué hacer con la imagen después de generarla

Este último punto merece detalle, porque es donde la mayoría se equivoca. La imagen que sale de ChatGPT está lista para ser vista, no para ser publicada.

Convierte al formato correcto. PNG es excelente para transparencia y pésimo para foto en la web. Para sitio web, WebP suele reducir el peso a la mitad sin diferencia visible; para envío común, JPG resuelve. El conversor de imagen hace el cambio directo en el navegador, y la guía de formatos de imagen ayuda a elegir.

Reduce el peso. Una imagen en 2K puede superar los 5 MB. El compresor de imagen recorta buena parte de eso sin pérdida visible — y si el archivo es realmente grande, el paso a paso de cómo reducir una imagen de MB a KB cubre los detalles.

Aísla el objeto cuando lo necesites. Para logos, productos y elementos que van sobre fondo de color, eliminar el fondo y guardar en PNG transparente es el paso que falta.

Ajusta resolución y encuadre. Si la imagen salió más pequeña de lo necesario, se puede aumentar la resolución sin perder calidad. Si salió en la proporción equivocada, recortar preserva más que estirar.

Aprovecha la paleta. Para mantener coherencia visual entre imágenes generadas en sesiones distintas, extrae los colores de la que salió mejor y cita esos tonos en los próximos prompts.

💡 Orden que funciona: descarga en resolución completa → recorta o redimensiona → convierte el formato → comprime al final. Comprimir antes de redimensionar desperdicia calidad.

Tres ejemplos de pedidos completos

Para cerrar, tres pedidos escritos de la forma que ChatGPT aprovecha mejor — nota que todos indican la finalidad, el texto exacto y la proporción.

Crea un cartel vertical de promoción para un taller de fotografía. El título debe ser "Luz Natural" en letras grandes arriba, y debajo, más pequeño, "sábado, 12 de julio — 14h a 18h". Fondo en tono terroso con una silueta de cámara en trazo fino. Estilo minimalista, tipografía sin serifas, mucho espacio vacío. Formato vertical para historias.
Genera una infografía horizontal con tres columnas iguales explicando las etapas de un proceso. Cada columna tiene un ícono simple arriba, un título corto y una frase de apoyo. Los títulos son "Recolectar", "Analizar" y "Publicar". Paleta en azul marino, blanco y un tono de naranja para destacar. Estilo editorial limpio, sin sombras. Formato widescreen.
Crea una foto de producto cuadrada de un tarro de crema blanca mate sobre piedra clara, con hojas verdes frescas alrededor y fondo beige suave. Luz natural difusa que viene de la izquierda, primer plano frontal, estética clean de skincare. Sin ningún texto en la imagen.

Checklist antes de generar

Deja tus imágenes listas para publicar

Las imágenes generadas en 2K fácilmente superan los 5 MB. Reduce el peso sin perder calidad visible, directo en el navegador.

Comprimir imagen

Preguntas frecuentes

¿Se puede crear imágenes en ChatGPT gratis?
Sí. La generación de imágenes está disponible en todos los planes, incluido el gratuito, en modo instantáneo. Lo que cambia es el volumen permitido, la velocidad en horarios pico y el acceso al modo con razonamiento, restringido a los planes pagos. OpenAI no divulga el número exacto de imágenes del plan gratuito, y ese límite varía según la demanda de la plataforma, así que cualquier número específico que encuentres por ahí debe tratarse como estimación.
¿ChatGPT todavía usa DALL·E?
No. Desde abril de 2026, la generación de imágenes corre en ChatGPT Images 2.0, un modelo nativo integrado al propio ChatGPT. DALL·E 2 y DALL·E 3 fueron retirados en mayo de 2026. La diferencia práctica es grande: como el modelo de imagen comparte contexto con el modelo de lenguaje, entiende el pedido directamente, sin la etapa intermedia de traducción que existía antes y que dejaba el resultado irregular.
¿Por qué el texto de mi imagen salió mal?
Dos causas cubren casi todos los casos. La primera es no haber escrito el texto entre comillas: sin esto el modelo interpreta la palabra como tema y puede parafrasear. La segunda es exceso de texto — párrafos largos y densos todavía tienen más probabilidad de error que títulos y frases cortas. Si el texto es esencial y sigue saliendo mal, el camino más confiable es generar la imagen sin texto y agregar las palabras después en un editor.
¿Cuál es la resolución máxima de las imágenes?
El modelo genera hasta 2K, con una amplia gama de proporciones que va de formatos ultra anchos a ultra altos. Esto cubre bien el uso digital: redes sociales, sitio web, presentación y miniatura. Para impresión en tamaño grande o fondo de pantalla de monitor 4K, es necesario ampliar la imagen después de la generación, lo que funciona bien cuando la imagen es limpia y poco detallada.
¿Puedo usar comercialmente las imágenes que genere?
Los términos de uso de OpenAI permiten el uso comercial de las imágenes que generas, pero las reglas pueden cambiar y varían según el plan y el país. Además, el uso comercial no es lo mismo que protección legal: en varias jurisdicciones, las obras creadas enteramente por una máquina enfrentan restricciones de registro de derechos de autor. Antes de usarlas en material de un cliente o producto a la venta, revisa los términos vigentes y evita pedidos que involucren marcas registradas, personajes licenciados o personas reales.
¿Cómo hago para que ChatGPT genere la imagen con fondo transparente?
Aunque se pida explícitamente, el resultado suele salir con fondo sólido en vez de transparencia real. El camino más rápido es pedir un fondo blanco liso, el más fácil de recortar, y crear la transparencia después eliminando el fondo y guardando en PNG. Este paso toma segundos y da un resultado más limpio que insistir con el modelo, que tiende a devolver un fondo a cuadros dibujado imitando transparencia.