Casi todo el mundo que empieza a generar imágenes con IA pasa meses intentando mejorar los resultados solo con el texto del prompt: cambia "bonito" por "deslumbrante", añade "8K", "ultra detallado", "obra maestra". Y el resultado sigue siendo parecido. El motivo es simple: buena parte de lo que define la imagen final no está en el texto, está en los parámetros.

Los parámetros son los controles numéricos que le dicen al modelo cómo dibujar, no qué dibujar. Proporción del lienzo, cuánto debe obedecer tu texto, cuántas etapas de refinamiento ejecuta, qué semilla aleatoria usa, cuánta libertad estética tiene. Son ellos los que separan a quien genera diez variaciones al azar de quien consigue repetir, ajustar y hacer evolucionar una imagen de forma controlada.

Esta guía es una referencia técnica de los cinco parámetros que aparecen prácticamente en todas las herramientas — relación de aspecto, seed, CFG, stylize y steps — más algunos vecinos que vale la pena conocer. La idea es que puedas volver aquí siempre que necesites recordar qué hace cada valor, en qué rango moverte y qué se rompe cuando te pasas.

Por qué los parámetros importan más que los adjetivos

Un modelo de difusión parte de ruido puro y va "limpiando" ese ruido paso a paso hasta llegar a una imagen. El prompt funciona como un mapa del destino; los parámetros definen la carretera, la velocidad y cuánto puede improvisar el conductor por el camino.

Eso explica por qué dos prompts idénticos generan imágenes completamente distintas, y por qué añadir más adjetivos muchas veces no cambia nada. Si el modelo ya tiene la obediencia al texto baja (CFG bajo), añadir palabras no sirve: sencillamente no les está prestando mucha atención. Si los steps están demasiado bajos, ningún adjetivo va a rescatar la textura de la imagen, porque el modelo no tuvo iteraciones suficientes para resolver los detalles.

La práctica que separa a los principiantes de la gente con experiencia es esta: cambia un parámetro cada vez. Si cambias el prompt, el seed y el CFG en el mismo intento, no vas a saber qué causó la mejora. Fijando el seed y tocando solo el CFG, aíslas la variable y aprendes de verdad cómo se comporta ese modelo.

💡 Consejo: antes de optimizar nada, genera cuatro imágenes con el mismo prompt y los parámetros por defecto. Te muestran el punto de partida del modelo. Solo después empieza a cambiar valores, y siempre de uno en uno.

Relación de aspecto: la proporción que define el encuadre

La relación de aspecto es la relación entre el ancho y el alto de la imagen. En Midjourney se escribe como --ar 16:9; en Stable Diffusion y derivados defines ancho y alto en píxeles; en ChatGPT y Gemini normalmente basta con pedirlo en lenguaje natural ("formato retrato 9:16").

Parece el parámetro más banal de la lista, pero es el que más influye en la composición. El modelo no recorta la misma escena en formatos distintos: la recompone. Un retrato pedido en 16:9 tiende a convertirse en un plano medio con fondo amplio; el mismo prompt en 2:3 se convierte en un primer plano vertical clásico de fotografía. La proporción cambia lo que la IA entiende como "encuadre natural" para esa escena.

Los valores más usados y para qué sirven

ProporciónUso típicoLo que suele hacer el modelo
1:1Avatar, feed de Instagram, icono, miniatura de productoCentra al sujeto, simplifica el fondo
4:5Publicación vertical de Instagram y FacebookPlano medio, buena presencia del sujeto
2:3Retrato fotográfico, póster, portada de libroPrimer plano o plano americano, estilo editorial
9:16Stories, Reels, TikTok, fondo de pantalla de móvilComposición vertical, mucho espacio arriba y abajo
16:9Miniatura de YouTube, banner, escena cinematográficaPlano abierto, paisaje, contexto alrededor
21:9Cinematográfico ultrapanorámico, portada de webPanorámica, sujeto pequeño en el cuadro
3:1Banner superior, portada de LinkedInFranja horizontal; suele exigir un prompt muy específico

Una trampa frecuente: las proporciones muy extremas (como 3:1 o 1:3) confunden a modelos entrenados sobre todo con imágenes cercanas al cuadrado. Es habitual que aparezca duplicación — dos caras, dos cabezas, elementos repetidos en los bordes — porque el modelo intenta "rellenar" un espacio del que no tiene una referencia fuerte. En esos casos, lo más seguro es generar en 16:9 y después usar el recorte o la expansión por outpainting para llegar al formato final.

Otro punto práctico: generar ya en la proporción correcta siempre es mejor que recortar después. Recortar descarta píxeles y reduce la resolución útil. Si necesitas la misma imagen en varios formatos, genérala en el más restrictivo (normalmente el vertical) y adapta el resto con un redimensionado controlado.

Seed: el número que hace repetible el resultado

El seed es el número entero que inicializa el ruido aleatorio del que nace la imagen. Mismo prompt + mismo seed + mismos parámetros + mismo modelo = la misma imagen, píxel a píxel. Si cambias el seed, cambia todo.

Es probablemente el parámetro más desaprovechado por los principiantes, y el más importante para quien trabaja con IA de forma profesional. Sin controlar el seed no puedes iterar: solo sortear de nuevo.

Los usos prácticos son tres:

Conviene entender una limitación importante: el seed es específico del modelo y de la versión. El seed 42 en SDXL no produce nada parecido al seed 42 en Flux. Si cambias de modelo, tus seeds antiguos se convierten en números sin significado. Por eso, anota siempre modelo + versión + seed juntos, nunca el seed solo.

💡 Consejo: cuando una generación salga bien, guarda de inmediato el conjunto completo: prompt, prompt negativo, seed, CFG, steps, sampler, modelo y proporción. Una hoja de cálculo sencilla con esas columnas vale más que cualquier carpeta de imágenes sueltas: sin esos datos, un resultado excelente es irreproducible.

Escala CFG: cuánto obedece la IA tu prompt

CFG significa Classifier-Free Guidance, y la escala de CFG controla el peso que el modelo le da a tu texto frente a lo que "querría" dibujar por su cuenta. En la práctica, es un mando de obediencia.

Los valores bajos dejan al modelo creativo y suelto, pero empieza a ignorar partes del prompt. Los valores altos fuerzan la adherencia literal, pero la imagen queda saturada, con contornos duros, contraste exagerado y un aspecto artificial: el clásico resultado "quemado".

Rango de CFGComportamientoCuándo usarlo
1–3Casi ignora el prompt; resultado imprevisible y etéreoExploración artística, texturas abstractas
4–6Interpretación libre, colores suaves, aspecto más naturalFotorrealismo, retratos, escenas orgánicas
7–9Equilibrio entre obediencia y naturalidad: el rango por defectoUso general; punto de partida recomendado
10–14Adherencia fuerte al texto, colores más intensosIlustración, diseño gráfico, composiciones específicas
15+Saturación, artefactos, bordes duros, distorsionesRara vez útil; solo en casos muy concretos

Un detalle que confunde a mucha gente: los modelos más nuevos usan rangos distintos. Flux, por ejemplo, trabaja con una escala de guidance propia en la que valores entre 2 y 4 son normales; poner 7 ahí ya es alto. Los modelos "turbo" y destilados, hechos para correr en pocos steps, suelen pedir CFG entre 1 y 2. Es decir: no existe un número universal, existe el número correcto para ese modelo. Consulta siempre la recomendación de quien publicó el checkpoint antes de dar por hecho que 7 es el valor por defecto.

Síntoma práctico de un CFG demasiado alto: piel con aspecto plástico, colores neón, halo oscuro alrededor de los contornos, texto o patrones repetidos de forma agresiva. Síntoma de un CFG demasiado bajo: la imagen es bonita, pero la mitad de lo que pediste no está.

Stylize: la estética propia del modelo

El parámetro --stylize (o --s) es característico de Midjourney y controla cuánto aplica el modelo su propia sensibilidad artística sobre tu petición. Es casi lo opuesto conceptual del CFG: en lugar de medir obediencia al texto, mide libertad estética.

La escala va de 0 a 1000, con 100 por defecto. En la práctica:

Hay un parámetro hermano que suele confundirse con este: --chaos (o --c, de 0 a 100), que controla la variedad entre las cuatro imágenes de un mismo lote, no el estilo de cada una. Un chaos alto entrega cuatro interpretaciones radicalmente distintas del mismo prompt: excelente para una lluvia de ideas inicial, pésimo cuando ya sabes lo que quieres. También existe --weird, que inyecta rareza deliberada y sirve más para experimentar que para trabajo de cliente.

Fuera de Midjourney no existe un equivalente directo de stylize. El efecto parecido se consigue por otras vías: LoRAs de estilo, palabras clave estéticas en el prompt o ajuste fino del CFG. Vale la pena conocer el concepto igualmente, porque la lógica de "cuánta personalidad puede poner el modelo" aparece de formas distintas en casi cualquier herramienta.

Steps: cuántas iteraciones ejecuta el modelo

Steps (o pasos de muestreo) es el número de etapas del proceso de eliminación de ruido. Cada step acerca un poco más la imagen al resultado final. Más steps significa más tiempo de procesamiento y, hasta cierto punto, más detalle.

La clave está en hasta cierto punto. Este parámetro tiene un rendimiento decreciente muy claro: la diferencia entre 10 y 25 steps es enorme; entre 30 y 60 es sutil; por encima de 80 es prácticamente imperceptible, y solo estás gastando tiempo y energía.

StepsResultadoObservación
1–8Solo funciona en modelos turbo/destiladosEn modelos normales sale borroso e incompleto
10–20Boceto rápido, formas definidas, detalle flojoBueno para probar composición y prompt
25–35Calidad de producción en la mayoría de los casosRango recomendado por defecto
40–60Ganancia marginal en escenas muy complejasSolo compensa con muchos elementos en cuadro
80+Sin ganancia perceptibleDesperdicio de tiempo y procesamiento

Steps y sampler están directamente ligados. Los samplers del tipo DPM++ 2M Karras convergen rápido y dan buen resultado en torno a 25 steps. Los samplers como Euler a (ancestral) nunca convergen del todo: la imagen sigue cambiando conforme subes los steps, lo que puede ser bueno (más variación para explorar) o malo (dificulta la reproducibilidad). Si tu objetivo es la consistencia, prefiere samplers no ancestrales.

Una decisión práctica de flujo de trabajo: haz la exploración inicial con steps bajos (15–20) para probar rápidamente decenas de prompts, y rehaz solo la versión final, con el seed ganador, a 30–40 steps. Eso ahorra mucho tiempo frente a ejecutarlo todo en calidad máxima desde el principio.

Los parámetros vecinos que también conviene conocer

Además de los cinco principales, algunos controles aparecen con frecuencia y resuelven problemas concretos:

Qué parámetros existen en cada herramienta

La nomenclatura varía bastante entre plataformas, y eso causa buena parte de la confusión. Esta tabla mapea los equivalentes:

HerramientaRelación de aspectoSeedCFG / guidanceStepsStylize
Midjourney--ar 16:9--seed 1234No expuestoNo expuesto--s 100
Stable Diffusion / ComfyUIAncho × altoCampo SeedCFG ScaleSampling stepsVía LoRA o prompt
FluxAncho × altoCampo SeedGuidance (2–4)20–30 típicoVía LoRA o prompt
ChatGPT / GPT ImageLenguaje naturalNo expuestoNo expuestoNo expuestoVía prompt
Gemini / Nano BananaLenguaje naturalNo expuestoNo expuestoNo expuestoVía prompt
Leonardo AIPresets + personalizadoCampo SeedGuidance ScalePresets de estilo

Fíjate en el patrón: cuanto más orientada al usuario final está la herramienta (ChatGPT, Gemini), menos parámetros expone; la plataforma decide por ti. Cuanto más cerca del modelo en bruto (ComfyUI, Automatic1111), más control. Ninguno de los dos enfoques es superior; atienden objetivos distintos. Si tu trabajo depende de repetir resultados, acabarás necesitando una herramienta que exponga seed y CFG.

Cómo interactúan los parámetros: recetas por objetivo

Los parámetros no funcionan aislados. Estas combinaciones son puntos de partida probados; ajústalos a tu modelo:

ObjetivoProporciónCFGStepsObservación
Retrato fotorrealista2:3 o 4:54–630El CFG bajo evita la piel plástica
Foto de producto1:17–930–35Fondo neutro en el prompt
Miniatura de YouTube16:99–1225CFG alto para colores fuertes
Ilustración / arte conceptual16:9 o 21:97–1030Stylize alto en Midjourney
Logo y marca1:18–1230Stylize bajo para fidelidad
Fondo de pantalla de móvil9:166–935Deja espacio libre para los iconos
Prueba rápida de prompt1:1715Solo para validar la idea

La lógica detrás de estas elecciones es consistente: el fotorrealismo pide CFG bajo (el modelo ya sabe cómo se ve una foto; forzarlo lo estropea); el diseño gráfico y el material promocional piden CFG alto (quieres exactamente esos elementos, en esos colores); y los steps solo suben cuando hay muchos detalles finos disputándose el espacio en la escena.

Errores comunes y cómo corregirlos

Lista rápida antes de generar

  1. Define la proporción según el destino final de la imagen, no según el valor por defecto de la herramienta.
  2. Empieza con los valores por defecto del modelo, y confirma cuáles son, porque varían.
  3. Haz una prueba barata: steps bajos, cuatro variaciones, solo para validar la dirección.
  4. Elige la mejor variación y anota el seed.
  5. Con el seed fijo, ajusta un parámetro cada vez hasta dar en el punto.
  6. Rehaz la versión final con steps de producción (30–40).
  7. Registra prompt, negativo, seed, CFG, steps, sampler, modelo y proporción.
  8. Haz la posproducción: upscale, recorte, ajuste de nitidez y compresión para web.

Después de generar: la etapa que casi todo el mundo se salta

Una imagen generada por IA rara vez sale lista para publicar. Suele llegar en un PNG pesado, en la resolución nativa del modelo y sin el recorte exacto que exige tu canal. Esa etapa final de tratamiento es lo que separa una imagen "de IA" de una imagen que simplemente funciona en tu web o en tu perfil.

La rutina básica de posproducción es corta: ajusta el encuadre con el recorte cuando la proporción final no coincida exactamente; llévala a la dimensión exacta del destino con el redimensionado; recupera el microdetalle con el ajuste de nitidez si la imagen fue ampliada; y, por último, conviértela a WebP y comprímela con el compresor, porque un PNG de 4 MB en la parte alta de la página hunde el PageSpeed por muy buena que sea la pieza.

Si la imagen va a formar parte de una identidad visual, el camino continúa en otras herramientas: extrae la paleta con el generador de paleta de colores para mantener la coherencia entre las piezas, y usa el creador de logos con IA cuando el objetivo sea la marca.

Ajusta tus imágenes de IA al formato correcto

Después de acertar con los parámetros, deja la imagen en la dimensión exacta de su destino: gratis, directo en el navegador y sin enviar nada a ningún servidor.

Redimensionar imagen ahora

Preguntas frecuentes

¿Cuál es el valor ideal de CFG para imágenes realistas?
En la mayoría de los modelos derivados de Stable Diffusion, el rango entre 4 y 6 entrega el resultado más natural para el fotorrealismo, porque los valores altos crean piel plástica y contraste exagerado. En Flux, que usa una escala de guidance distinta, el equivalente suele quedar entre 2 y 4. Confirma siempre la recomendación específica del modelo que estás usando antes de dar por hecho un número por defecto.
¿El mismo seed genera la misma imagen en herramientas distintas?
No. El seed solo es reproducible dentro del mismo modelo, en la misma versión y con los mismos parámetros. El seed 12345 en SDXL no tiene ninguna relación con el seed 12345 en Flux o en Midjourney. Por eso es esencial anotar el modelo y la versión junto al número: el seed aislado no lleva información útil.
¿Aumentar los steps siempre mejora la calidad de la imagen?
No. La ganancia es muy grande hasta unos 25 o 30 steps y después cae rápidamente. Por encima de 60 la diferencia es prácticamente imperceptible, y por encima de 80 solo estás gastando tiempo de procesamiento. Si la imagen tiene problemas de anatomía o le faltan elementos, el culpable es el prompt o el modelo, no la cantidad de steps.
¿Cuál es la diferencia entre stylize y chaos en Midjourney?
El stylize controla cuánto aplica el modelo su propia estética artística sobre tu petición, afectando a la iluminación, la paleta y la composición de cada imagen. El chaos controla la variedad entre las cuatro imágenes de un mismo lote: con chaos alto recibes cuatro interpretaciones muy distintas del mismo prompt. Usa chaos alto en la fase de exploración y bajo cuando ya conozcas la dirección deseada.
¿Por qué aparecen personas u objetos duplicados en la imagen?
Suele ocurrir cuando la proporción es muy extrema o la resolución está bastante por encima de aquella con la que se entrenó el modelo. El modelo intenta rellenar el espacio extra repitiendo elementos que ya reconoce. La solución es generar en una proporción más cercana al cuadrado o al 16:9, en la resolución nativa del modelo, y después expandir con outpainting o ampliar con upscale.
¿Cómo controlo los parámetros en ChatGPT o Gemini, que no exponen esos campos?
Estas herramientas esconden los controles numéricos y deciden los valores internamente, así que el ajuste se hace con lenguaje natural en el propio prompt: pide el formato explícitamente, describe el nivel de detalle e indica si quieres una lectura más literal o más artística de la escena. Si tu trabajo exige reproducibilidad exacta, el camino es usar una herramienta que exponga seed y CFG, como ComfyUI, Automatic1111 o Leonardo AI.