Crear imágenes en ChatGPT dejó de ser una función paralela y se convirtió en una de las cosas que la herramienta hace mejor. Desde abril de 2026, la generación de imágenes corre en ChatGPT Images 2.0, un modelo nativo que reemplazó definitivamente a DALL·E — retirado en mayo del mismo año — y que resolvió el problema más persistente de toda IA de imagen: escribir texto dentro de la figura sin errar las letras.
Esto cambia el tipo de cosas que se pueden hacer. Cartel con título legible, infografía con números correctos, portada con el nombre de la marca, página de cómic con diálogos, mockup de empaque con etiqueta — todo eso salía torcido antes y ahora sale limpio en la mayoría de los intentos.
Esta guía cubre el camino completo: cómo generar la primera imagen, cómo escribir el prompt de la forma que ChatGPT entiende mejor, cómo editar sin regenerar todo, cómo mantener el mismo personaje entre imágenes, qué cambia entre el plan gratuito y el pago, y lo que la herramienta todavía no hace bien.
Qué cambió en la generación de imágenes de ChatGPT
Hasta 2025, ChatGPT generaba imágenes activando DALL·E como un sistema aparte: escribías, él traducía tu pedido en un prompt interno y lo enviaba a otro modelo. El resultado era irregular, porque había una traducción en el medio que no controlabas.
Hoy el modelo de imagen es nativo y comparte contexto con el modelo de lenguaje. En la práctica esto significa que entiende el pedido de la misma forma que entiende una pregunta de texto: si dices "haz un cartel para una cafetería que abre a las 7h en Porto Alegre", no necesita que describas cada elemento visual — deduce el layout, la jerarquía y el contenido.
Tres consecuencias prácticas importan más que las otras:
- El texto dentro de la imagen funciona. Títulos, párrafos, etiquetas, leyendas e incluso texto en varios idiomas salen legibles. Era el mayor talón de Aquiles de las IAs de imagen.
- El layout complejo es posible. Infografías, spreads de revista, fichas de personaje y páginas con múltiples paneles dejaron de ser cuestión de suerte.
- La consistencia entre imágenes mejoró. Se puede generar un conjunto de imágenes manteniendo el mismo personaje o el mismo producto.
💡 Vale saber: los límites de generación de imagen en el plan gratuito no se divulgan oficialmente y cambian según la demanda de la plataforma. Trata cualquier número que veas por ahí como estimación, no como regla fija.
Cómo generar tu primera imagen, paso a paso
El flujo es lo más simple posible — no existe panel aparte ni configuración previa obligatoria.
- Abre una conversación nueva. No es necesario seleccionar ningún modo especial; basta con pedirlo.
- Describe la imagen en lenguaje natural. Escribe como si estuvieras explicando a un diseñador, en frases completas. No uses lista de palabras separadas por comas: ese formato es de otras herramientas y aquí rinde menos.
- Indica la proporción. "Formato vertical para historias", "cuadrado para Instagram", "horizontal 16:9". Si no lo dices, él elige solo.
- Espera la generación. Las imágenes toman más tiempo que las respuestas de texto, especialmente las de layout denso.
- Pide ajustes en la misma conversación. "Oscurece más el fondo", "agranda el título", "cambia el color del abrigo a rojo". Mantiene la imagen y cambia solo lo que pediste.
- Descarga en resolución completa. Usa el botón de descarga, y no captura de pantalla — la captura pierde calidad y sale en el tamaño de tu ventana.
Este último punto es más importante de lo que parece. Mucha gente guarda la imagen haciendo clic derecho en la miniatura y termina con un archivo pequeño y recomprimido.
Los dos modos: instantáneo y razonamiento
ChatGPT Images 2.0 opera en dos modos, y entender la diferencia evita frustración.
El modo instantáneo genera directo a partir de tu pedido. Es rápido, está disponible en todos los planes incluido el gratuito, y cubre bien imágenes simples: una escena, un retrato, una ilustración, un fondo.
El modo con razonamiento — el "thinking" — hace que el modelo planee antes de dibujar: verifica la cantidad de objetos, revisa las restricciones que pediste, organiza el layout y, cuando es necesario, busca en la web para traer información actualizada dentro de la imagen. Es este modo el que entrega infografía correcta, cartel con datos reales y composición con muchos elementos alineados. Está restringido a los planes pagos.
En la práctica: si tu pedido tiene una sola escena, el modo instantáneo basta. Si tiene conteo ("exactamente cinco íconos"), jerarquía de texto o datos que necesitan estar correctos, el razonamiento marca una diferencia real.
Cómo escribir prompts que ChatGPT entiende mejor
Aquí está la mayor diferencia entre ChatGPT y herramientas como Midjourney: prefiere prosa a lista de etiquetas. Escribir "mujer, 35 años, blazer gris, oficina, 85mm, bokeh" funciona, pero rinde menos que la misma información en frases.
Empieza por la función de la imagen, no por la descripción
Decir para qué sirve cambia todo el resultado. "Un cartel de promoción para el taller de fotografía del día 12" produce algo mucho más utilizable que "una imagen con una cámara y un texto". El modelo usa la finalidad para decidir jerarquía, espacio y estilo.
Escribe el texto exacto entre comillas
Cuando la imagen necesita contener palabras, escríbelas literalmente y entre comillas: el título "Desayuno", el subtítulo "todos los sábados, de 8h a 11h". Sin comillas, el modelo puede parafrasear o inventar. Y di dónde va cada texto: arriba, pie de página, esquina inferior derecha.
Describe la estructura antes que el estilo
El orden que funciona es: qué aparece y dónde → luego cómo se ve. "Tres columnas iguales, ícono arriba de cada una, título debajo y un párrafo corto abajo; estilo minimalista con fondo beige y tipografía sin serifas." La estructura primero da mucho menos retrabajo.
Sé explícito sobre lo que no quieres
ChatGPT no tiene campo de prompt negativo. La restricción entra dentro del propio pedido, y funciona mejor en forma afirmativa: "composición limpia, sin ningún texto además del título" rinde más que "sin texto".
Itera en vez de reescribir
Es el mayor diferencial de la interfaz conversacional. No reescribas el prompt desde cero cuando algo sale mal: pide la corrección. "Mantén todo, pero cambia el fondo a azul marino" preserva lo que ya estaba bien. Reescribir el prompt entero genera una imagen nueva sin relación con la anterior.
💡 Atajo útil: pídele al propio ChatGPT que mejore tu prompt antes de generar. "Reescribe este pedido como un prompt detallado de imagen, sin generar nada todavía" suele revelar detalles en los que no habías pensado.
Proporción y resolución: qué pedir
El modelo acepta una amplia gama de formatos, de ultra anchos a ultra altos, y genera hasta 2K. Definir la proporción antes de generar evita el recorte después — y el recorte después siempre cuesta composición.
| Destino | Cómo pedirlo | Proporción |
|---|---|---|
| Feed de Instagram | formato cuadrado | 1:1 |
| Feed vertical / retrato | formato retrato para feed | 4:5 |
| Historias y Reels | formato vertical de historias | 9:16 |
| Miniatura de YouTube | formato horizontal widescreen | 16:9 |
| Banner de sitio web | formato panorámico ancho | 3:1 |
| Portada de e-book | formato vertical de portada de libro | 2:3 |
| Fondo de pantalla de escritorio | formato horizontal widescreen | 16:9 |
Si necesitas una resolución específica — 1920 por 1080, por ejemplo — genera en la proporción correcta y ajusta después con el redimensionador de imagen. Pedir dimensiones exactas en píxeles dentro del prompt rara vez se respeta al pie de la letra.
Editar imágenes: los comandos que funcionan
Editar es donde ChatGPT se destaca frente a herramientas de generación pura. No necesitas máscara, capa ni selección — describes con palabras.
Alterar un elemento específico
"Mantén la composición y cambia solo el color de la pared a verde salvia." Cuanto más explícito seas sobre lo que debe permanecer igual, menos toca el modelo el resto. La palabra "mantén" hace un trabajo sorprendentemente grande aquí.
Agregar o quitar objetos
"Quita la planta de la esquina derecha y deja la pared lisa." Funciona bien con objetos claramente delimitados. Las eliminaciones en áreas con mucha textura de fondo a veces dejan marcas — en ese caso, generar de nuevo suele salir mejor que insistir con la edición.
Cambiar el estilo manteniendo la escena
"Misma composición, mismos elementos, pero en estilo acuarela." Es útil para probar lenguajes visuales distintos sin perder el encuadre que ya aprobaste.
Editar a partir de una imagen tuya
Puedes enviar una foto y pedir cambios: cambiar el fondo, ajustar la iluminación, transformar en ilustración, crear variaciones. Vale recordar que el resultado es una imagen nueva generada a partir de la tuya, no una edición pixel a pixel del original.
Expandir el encuadre
"Expande esta imagen al formato horizontal, continuando el escenario naturalmente hacia los lados." Es el equivalente conversacional del outpainting, y resuelve el caso clásico de tener una imagen vertical que necesita convertirse en banner.
Cómo mantener el mismo personaje en varias imágenes
Este era el problema más difícil de las IAs de imagen y se volvió bastante más manejable. Tres enfoques, del más simple al más confiable.
Continuar en la misma conversación. Es el método más fácil y el más eficaz en el día a día. Después de generar el personaje, pide la siguiente escena sin redescribirlo: "ahora muestra al mismo personaje sentado en un café". El modelo carga el contexto de la conversación y mantiene los rasgos.
Describir rasgos fijos por escrito. Arma una descripción corta e inmutable — cabello, ojos, ropa característica, accesorio distintivo — y repite exactamente las mismas palabras en todos los pedidos. Los sinónimos estorban: "abrigo beige" y "sobretodo color arena" producen piezas distintas.
Pedir una hoja de referencia primero. Genera una ficha de personaje con el mismo rostro en varios ángulos y expresiones, y usa esa imagen como referencia en las generaciones siguientes. Es el camino más laborioso y el más consistente, especialmente para series largas.
Vale la misma lógica para productos y para identidad de marca: cuanto más fija la descripción, más estable el resultado.
Gratuito o pago: qué cambia realmente
La generación de imágenes está disponible en todos los planes, incluido el gratuito. Lo que varía es el volumen, la velocidad y el acceso al modo con razonamiento.
| Aspecto | Plan gratuito | Planes pagos |
|---|---|---|
| Generación de imagen | Disponible, modo instantáneo | Disponible, instantáneo y razonamiento |
| Volumen | Limitado, cuota no divulgada | Bastante más alto |
| Velocidad | Más lenta, sujeta a cola | Prioridad en horarios pico |
| Búsqueda en la web durante la generación | No | Sí, en modo razonamiento |
| Layouts complejos e infografías | Resultado irregular | Bastante más confiable |
| Conjuntos de imágenes consistentes | Limitado | Sí |
Para uso personal ocasional — un fondo de pantalla, una ilustración para un post, una imagen de apoyo — el plan gratuito resuelve. Para trabajo recurrente con layout, texto y volumen, la diferencia aparece rápido. Si quieres comparar con otras opciones antes de suscribirte, la guía de las mejores IAs para crear imágenes pone los principales nombres lado a lado, y la guía de Gemini para crear imágenes cubre la principal alternativa.
Lo que ChatGPT todavía no hace bien
Conocer las limitaciones ahorra tiempo. Ninguna de ellas es defecto de prompt: son límites de la herramienta.
- Personas reales. Generar imágenes de personas identificables, especialmente figuras públicas, está bloqueado. No sirve reformular el pedido.
- Marcas y personajes licenciados. Los logotipos de empresas existentes y personajes protegidos por derechos de autor también son rechazados.
- Vector real. La salida siempre es rasterizada, en píxeles. Si necesitas un archivo editable en curvas, el resultado sirve como referencia para rediseñar, no como archivo final.
- Fondo transparente confiable. Aunque se pida, la imagen suele salir con fondo sólido. La transparencia es más rápida de resolver después, eliminando el fondo.
- Resolución superior a 2K. Para impresión grande o monitor 4K, es necesario ampliar después.
- Reproducción exacta de una foto tuya. Al editar una imagen enviada, el modelo regenera la escena. Los detalles finos del original cambian.
Siete errores que más estorban
- Escribir en formato de etiquetas. Lista de palabras separadas por comas es el lenguaje de otras herramientas. Aquí, la prosa rinde más.
- No indicar la proporción. Sin indicación, el modelo elige — y casi siempre elige el formato equivocado para tu uso.
- Reescribir el prompt en cada intento. Pierdes lo que ya habías logrado. Pide correcciones puntuales.
- Dejar el texto suelto en el pedido. Sin comillas y sin posición, el modelo parafrasea o lo coloca donde quiera.
- Guardar por captura de pantalla. Pierde resolución y agrega recompresión. Usa la descarga.
- Pedir todo de una vez. Prompts con diez exigencias simultáneas suelen fallar en dos o tres. Genera la base y ajusta por etapas.
- Publicar directo sin optimizar. Una imagen de 2K en PNG pesa varios megabytes y frena la carga de cualquier página.
Qué hacer con la imagen después de generarla
Este último punto merece detalle, porque es donde la mayoría se equivoca. La imagen que sale de ChatGPT está lista para ser vista, no para ser publicada.
Convierte al formato correcto. PNG es excelente para transparencia y pésimo para foto en la web. Para sitio web, WebP suele reducir el peso a la mitad sin diferencia visible; para envío común, JPG resuelve. El conversor de imagen hace el cambio directo en el navegador, y la guía de formatos de imagen ayuda a elegir.
Reduce el peso. Una imagen en 2K puede superar los 5 MB. El compresor de imagen recorta buena parte de eso sin pérdida visible — y si el archivo es realmente grande, el paso a paso de cómo reducir una imagen de MB a KB cubre los detalles.
Aísla el objeto cuando lo necesites. Para logos, productos y elementos que van sobre fondo de color, eliminar el fondo y guardar en PNG transparente es el paso que falta.
Ajusta resolución y encuadre. Si la imagen salió más pequeña de lo necesario, se puede aumentar la resolución sin perder calidad. Si salió en la proporción equivocada, recortar preserva más que estirar.
Aprovecha la paleta. Para mantener coherencia visual entre imágenes generadas en sesiones distintas, extrae los colores de la que salió mejor y cita esos tonos en los próximos prompts.
💡 Orden que funciona: descarga en resolución completa → recorta o redimensiona → convierte el formato → comprime al final. Comprimir antes de redimensionar desperdicia calidad.
Tres ejemplos de pedidos completos
Para cerrar, tres pedidos escritos de la forma que ChatGPT aprovecha mejor — nota que todos indican la finalidad, el texto exacto y la proporción.
Checklist antes de generar
- ¿Dijiste para qué sirve la imagen, y no solo lo que muestra?
- ¿La proporción está declarada?
- ¿El texto que debe aparecer está entre comillas, con posición definida?
- ¿Se describió la estructura antes que el estilo?
- ¿Las restricciones están escritas en forma afirmativa?
- ¿Estás pidiendo una corrección en vez de reescribir todo?
- ¿Vas a descargar en resolución completa, y no por captura de pantalla?
Deja tus imágenes listas para publicar
Las imágenes generadas en 2K fácilmente superan los 5 MB. Reduce el peso sin perder calidad visible, directo en el navegador.
Comprimir imagen