Prawie każdy, kto zaczyna generować obrazy z AI, miesiącami próbuje poprawiać wyniki wyłącznie tekstem promptu: zamienia „ładny” na „olśniewający”, dorzuca „8K”, „ultra szczegółowe”, „arcydzieło”. A efekt wygląda podobnie. Powód jest prosty: spora część tego, co decyduje o obrazie, w ogóle nie siedzi w tekście — siedzi w parametrach.

Parametry to liczbowe ustawienia, które mówią modelowi jak ma rysować, a nie co ma narysować. Proporcja kadru, stopień posłuszeństwa wobec tekstu, liczba etapów dopracowania, ziarno losowości, zakres swobody estetycznej. To one dzielą osoby generujące dziesięć przypadkowych wariantów od tych, które potrafią obraz powtórzyć, doszlifować i rozwinąć w kontrolowany sposób.

Ten przewodnik jest techniczną ściągawką z pięciu parametrów obecnych praktycznie w każdym narzędziu — aspect ratio, seed, CFG, stylize i steps — oraz z kilku pokrewnych, które warto znać. Chodzi o to, żebyś mógł tu wracać zawsze, gdy potrzebujesz przypomnieć sobie, co robi dana wartość, w jakim zakresie ją ruszać i co się psuje przy przesadzie.

Dlaczego parametry znaczą więcej niż przymiotniki

Model dyfuzyjny startuje z czystego szumu i krok po kroku go „oczyszcza”, aż powstanie obraz. Prompt działa jak mapa z celem podróży, a parametry wyznaczają drogę, prędkość i to, ile kierowca może po drodze zaimprowizować.

To tłumaczy, dlaczego dwa identyczne prompty dają zupełnie inne obrazy i dlaczego dokładanie przymiotników często niczego nie zmienia. Jeśli model ma niskie posłuszeństwo wobec tekstu (niskie CFG), dorzucanie słów nic nie da — po prostu nie zwraca na nie większej uwagi. Jeśli kroków jest za mało, żaden przymiotnik nie uratuje faktury obrazu, bo model nie miał dość iteracji, żeby dopracować detale.

Praktyka, która oddziela początkujących od doświadczonych, jest jedna: zmieniaj po jednym parametrze naraz. Jeśli w jednym podejściu zmienisz prompt, seed i CFG, nie dowiesz się, co odpowiadało za poprawę. Blokując seed i ruszając wyłącznie CFG, izolujesz zmienną i naprawdę uczysz się, jak zachowuje się dany model.

💡 Wskazówka: zanim zaczniesz cokolwiek optymalizować, wygeneruj cztery obrazy z tym samym promptem i domyślnymi ustawieniami. Pokażą ci punkt wyjścia danego modelu. Dopiero potem zacznij zmieniać wartości — i zawsze po jednej.

Aspect ratio: proporcja, która decyduje o kadrze

Aspect ratio, czyli proporcja obrazu, to stosunek szerokości do wysokości. W Midjourney zapisuje się go jako --ar 16:9; w Stable Diffusion i pochodnych podajesz szerokość i wysokość w pikselach; w ChatGPT i Gemini zwykle wystarczy poprosić zwykłym zdaniem („format pionowy 9:16”).

Wygląda na najbardziej banalny parametr z całej listy, a najmocniej wpływa na kompozycję. Model nie tnie tej samej sceny na różne formaty — on ją komponuje od nowa. Portret zamówiony w 16:9 zwykle staje się planem średnim z szerokim tłem, a ten sam prompt w 2:3 daje klasyczne pionowe zbliżenie. Proporcja zmienia to, co AI uznaje za „naturalny kadr” dla danej sceny.

Najczęstsze wartości i ich zastosowania

ProporcjaTypowe zastosowanieCo zwykle robi model
1:1Awatar, strumień na Instagramie, ikona, miniatura produktuWyśrodkowuje temat, upraszcza tło
4:5Pionowy post na Instagramie i FacebookuPlan średni, wyraźnie obecny temat
2:3Portret fotograficzny, plakat, okładka książkiZbliżenie albo plan amerykański, styl edytorialowy
9:16Relacje, rolki, TikTok, tapeta na telefonKompozycja pionowa, dużo przestrzeni u góry i u dołu
16:9Miniatura na YouTube, baner, scena filmowaPlan szeroki, krajobraz, otoczenie wokół tematu
21:9Filmowy ultrapanoramiczny kadr, nagłówek stronyPanorama, niewielki temat w kadrze
3:1Baner nagłówkowy, tło na LinkedInWąski pas poziomy; zwykle wymaga bardzo precyzyjnego promptu

Częsta pułapka: bardzo skrajne proporcje (jak 3:1 czy 1:3) dezorientują modele trenowane głównie na obrazach zbliżonych do kwadratu. Często pojawiają się wtedy duplikaty — dwie twarze, dwie głowy, powielone elementy przy krawędziach — bo model próbuje „zapełnić” przestrzeń, dla której nie ma mocnego punktu odniesienia. W takich sytuacjach bezpieczniej wygenerować obraz w 16:9, a następnie użyć Kadrowanie obrazu albo rozszerzyć kadr outpaintingiem do docelowego formatu.

Druga praktyczna uwaga: lepiej od razu generować we właściwej proporcji, niż przycinać później. Przycinanie odrzuca piksele i obniża użyteczną rozdzielczość. Jeśli potrzebujesz tego samego obrazu w kilku formatach, wygeneruj go w najbardziej wymagającym (zwykle pionowym), a pozostałe dopasuj przez kontrolowane Zmień rozmiar .

Seed: liczba, dzięki której wynik da się powtórzyć

Seed to liczba całkowita inicjująca losowy szum, z którego rodzi się obraz. Ten sam prompt plus ten sam seed, te same parametry i ten sam model dają identyczny obraz, piksel w piksel. Zmienił się seed — zmieniło się wszystko.

To prawdopodobnie najbardziej niedoceniany parametr wśród początkujących i zarazem najważniejszy dla osób pracujących z AI zawodowo. Bez kontroli nad seedem nie da się iterować — można tylko losować od nowa.

Zastosowania są trzy:

Warto znać jedno ważne ograniczenie: seed jest przypisany do konkretnego modelu i wersji. Seed 42 w SDXL nie da niczego podobnego do seeda 42 we Fluksie. Po zmianie modelu stare seedy stają się liczbami bez znaczenia. Dlatego zawsze zapisuj razem model, wersję i seed , nigdy sam seed.

💡 Wskazówka: gdy generowanie się uda, od razu zapisz komplet danych: prompt, prompt negatywny, seed, CFG, steps, sampler, model i proporcję. Prosty arkusz z tymi kolumnami jest wart więcej niż jakikolwiek zbiór luźnych plików — bez tych informacji świetny wynik pozostaje nie do odtworzenia.

CFG Scale: jak bardzo AI słucha twojego promptu

CFG to skrót od Classifier-Free Guidance, a skala CFG określa, jaką wagę model przypisuje twojemu tekstowi w porównaniu z tym, co „chciałby” narysować sam z siebie. To w praktyce pokrętło posłuszeństwa.

Niskie wartości dają modelowi swobodę i kreatywność, ale zaczyna wtedy pomijać fragmenty promptu. Wysokie wymuszają dosłowność, za to obraz robi się przesycony, z twardymi konturami, przesadzonym kontrastem i sztucznym wyglądem — mówi się wtedy o obrazie przepalonym, czyli overcooked.

Zakres CFGZachowanieKiedy stosować
1–3Prawie ignoruje prompt; wynik nieprzewidywalny i eterycznyPoszukiwania artystyczne, abstrakcyjne faktury
4–6Swobodna interpretacja, łagodne barwy, naturalniejszy wyglądFotorealizm, portrety, sceny organiczne
7–9Równowaga między posłuszeństwem a naturalnością — zakres domyślnyZastosowania ogólne; zalecany punkt wyjścia
10–14Silne trzymanie się tekstu, intensywniejsze barwyIlustracja, projektowanie graficzne, ściśle określone kompozycje
15+Przesycenie, artefakty, twarde krawędzie, zniekształceniaRzadko przydatne; tylko w bardzo szczególnych przypadkach

Ważny szczegół, który wielu osobom umyka: nowsze modele mają inne zakresy. Flux korzysta z własnej skali guidance, w której normą są wartości od 2 do 4 — wpisanie tam 7 to już dużo. Modele turbo i destylowane, przystosowane do pracy na kilku krokach, zwykle oczekują CFG między 1 a 2. Innymi słowy: uniwersalna liczba nie istnieje, istnieje liczba właściwa dla danego modelu. Zawsze sprawdź zalecenia autora checkpointu, zanim uznasz, że 7 to wartość domyślna.

Objawy zbyt wysokiego CFG: plastikowa skóra, neonowe barwy, ciemna poświata wokół konturów, agresywnie powielony tekst albo wzory. Objaw zbyt niskiego CFG: obraz jest ładny, ale połowy tego, o co prosiłeś, w nim nie ma.

Stylize: własna estetyka modelu

Parametr --stylize (albo --s) jest charakterystyczny dla Midjourney i określa, ile własnej wrażliwości artystycznej model nałoży na twoje polecenie. Koncepcyjnie to niemal odwrotność CFG: zamiast mierzyć posłuszeństwo wobec tekstu, mierzy swobodę estetyczną.

Skala biegnie od 0 do 1000, a wartość domyślna to 100. W praktyce:

Istnieje bliźniaczy parametr, który bywa z nim mylony: --chaos (albo --c, od 0 do 100), sterujący różnorodnością czterech obrazów z jednej partii, a nie stylem każdego z osobna. Wysoki chaos daje cztery radykalnie odmienne odczytania tego samego promptu — znakomite przy wstępnej burzy mózgów, fatalne, gdy wiesz już, czego chcesz. Jest jeszcze --weird, który celowo dodaje dziwności i nadaje się raczej do eksperymentów niż do pracy dla klienta.

Poza Midjourney nie ma bezpośredniego odpowiednika stylize. Podobny efekt uzyskuje się inaczej: przez stylowe LoRA, estetyczne słowa kluczowe w prompcie albo precyzyjne dostrojenie CFG. Sam koncept warto jednak znać, bo logika „ile własnej osobowości model może dołożyć” wraca pod różnymi postaciami w prawie każdym narzędziu.

Steps: ile iteracji wykonuje model

Steps (czyli sampling steps) to liczba etapów usuwania szumu. Każdy krok przybliża obraz do wyniku końcowego. Więcej kroków oznacza dłuższe przetwarzanie i — do pewnego momentu — więcej detalu.

Kluczowe są słowa do pewnego momentu. Ten parametr ma bardzo wyraźnie malejący zwrot: różnica między 10 a 25 krokami jest ogromna, między 30 a 60 subtelna, a powyżej 80 praktycznie niezauważalna — marnujesz wtedy tylko czas i prąd.

StepsWynikUwagi
1–8Działa tylko w modelach turbo i destylowanychW zwykłych modelach obraz wychodzi rozmyty i niedokończony
10–20Szybki szkic, czytelne kształty, słaby detalDobre do sprawdzania kompozycji i promptu
25–35Jakość produkcyjna w większości przypadkówZalecany zakres domyślny
40–60Marginalny zysk przy bardzo złożonych scenachOpłaca się tylko przy obrazach z wieloma elementami
80+Bez zauważalnego zyskuMarnowanie czasu i mocy obliczeniowej

Steps i sampler są ze sobą ściśle powiązane. Samplery pokroju DPM++ 2M Karras zbiegają szybko i dają dobry efekt w okolicach 25 kroków. Samplery typu Euler a (ancestralne) nigdy nie zbiegają do końca — obraz zmienia się wraz z każdym dodanym krokiem, co bywa zaletą (więcej wariacji do zbadania) albo wadą (utrudniona odtwarzalność). Jeśli zależy ci na spójności, wybieraj samplery nieancestralne.

Praktyczna decyzja organizacyjna: wstępne poszukiwania prowadź na niskich krokach (15–20), żeby szybko przetestować dziesiątki promptów, a wersję ostateczną — ze zwycięskim seedem — powtórz na 30–40 krokach. To oszczędza mnóstwo czasu w porównaniu z generowaniem wszystkiego w maksymalnej jakości od początku.

Parametry pokrewne, które też warto znać

Poza piątką najważniejszych często pojawiają się ustawienia rozwiązujące konkretne problemy:

Które parametry występują w poszczególnych narzędziach

Nazewnictwo mocno różni się między platformami i stąd bierze się większość nieporozumień. Ta tabela zestawia odpowiedniki:

NarzędzieAspect ratioSeedCFG / guidanceStepsStylize
Midjourney--ar 16:9--seed 1234NiedostępnyNiedostępny--s 100
Stable Diffusion / ComfyUISzerokość × wysokośćPole SeedCFG ScaleSampling stepsPrzez LoRA albo prompt
FluxSzerokość × wysokośćPole SeedGuidance (2–4)Zwykle 20–30Przez LoRA albo prompt
ChatGPT / GPT ImageJęzyk naturalnyNiedostępnyNiedostępnyNiedostępnyPrzez prompt
Gemini / Nano BananaJęzyk naturalnyNiedostępnyNiedostępnyNiedostępnyPrzez prompt
Leonardo AIUstawienia gotowe i własnePole SeedGuidance ScaleTakGotowe style

Zwróć uwagę na prawidłowość: im bardziej narzędzie celuje w zwykłego użytkownika (ChatGPT, Gemini), tym mniej parametrów udostępnia — platforma decyduje za ciebie. Im bliżej surowego modelu (ComfyUI, Automatic1111), tym więcej kontroli. Żadne z tych podejść nie jest lepsze; po prostu służą różnym celom. Jeśli twoja praca opiera się na powtarzalności wyników, prędzej czy później będziesz potrzebować narzędzia z dostępem do seeda i CFG.

Jak parametry na siebie działają: przepisy według celu

Parametry nie działają w oderwaniu od siebie. Poniższe zestawy to sprawdzone punkty wyjścia — dostosuj je do swojego modelu:

CelProporcjaCFGStepsUwagi
Portret fotorealistyczny2:3 albo 4:54–630Niskie CFG chroni przed plastikową skórą
Zdjęcie produktowe1:17–930–35Neutralne tło zapisane w prompcie
Miniatura na YouTube16:99–1225Wysokie CFG dla mocnych barw
Ilustracja i grafika koncepcyjna16:9 albo 21:97–1030Wysoki stylize w Midjourney
Logo i marka1:18–1230Niski stylize dla wierności
Tapeta na telefon9:166–935Zostaw wolne miejsce na ikony
Szybki test promptu1:1715Wyłącznie do sprawdzenia pomysłu

Logika tych wyborów jest spójna: fotorealizm wymaga niskiego CFG (model wie, jak wygląda zdjęcie, więc nadmierne wymuszanie tylko psuje efekt), projektowanie graficzne i materiały promocyjne wymagają wysokiego (chcesz dokładnie tych elementów w dokładnie tych kolorach), a liczbę kroków podnosi się tylko wtedy, gdy w kadrze rywalizuje o miejsce wiele drobnych detali.

Częste błędy i sposoby na nie

Szybka lista kontrolna przed generowaniem

  1. Dobierz proporcję pod docelowe miejsce publikacji obrazu, a nie pod domyślne ustawienie narzędzia.
  2. Zacznij od wartości domyślnych modelu — i sprawdź, jakie one są, bo bywają różne.
  3. Zrób tani test: niskie kroki, cztery wariacje, wyłącznie do potwierdzenia kierunku.
  4. Wybierz najlepszą wariację i zapisz jej seed.
  5. Przy zablokowanym seedzie zmieniaj po jednym parametrze, aż trafisz w punkt.
  6. Powtórz wersję ostateczną na krokach produkcyjnych (30–40).
  7. Zapisz prompt, prompt negatywny, seed, CFG, steps, sampler, model i proporcję.
  8. Zrób postprodukcję: upscale, kadrowanie, wyostrzenie i kompresję pod internet.

Po wygenerowaniu: etap, który prawie wszyscy pomijają

Obraz z AI rzadko nadaje się do publikacji od razu. Zwykle przychodzi jako ciężki PNG, w natywnej rozdzielczości modelu, bez kadru, jakiego wymaga twój kanał. To właśnie ten końcowy etap obróbki odróżnia „obrazek z AI” od grafiki, która po prostu działa na twojej stronie czy profilu.

Podstawowa procedura jest krótka: popraw kadr narzędziem Kadrowanie obrazu , gdy końcowa proporcja nie zgadza się co do piksela; ustaw dokładny wymiar docelowy narzędziem Zmień rozmiar; przywróć mikrodetal narzędziem Wyostrzanie , jeśli obraz był powiększany; a na koniec przekonwertuj plik na WebP i skompresuj go narzędziem Kompresuj, bo PNG ważący 4 MB na górze strony zabija wynik PageSpeed niezależnie od tego, jak dobra jest sama grafika.

Jeśli obraz ma stać się częścią identyfikacji wizualnej, droga wiedzie dalej: wyciągnij paletę narzędziem Paleta , żeby zachować spójność wszystkich materiałów, a przy pracy nad marką sięgnij po Kreator logo AI .

Dopasuj swoje obrazy z AI do właściwego formatu

Gdy parametry są już dopięte, ustaw dokładny wymiar docelowy — za darmo, prosto w przeglądarce i bez wysyłania czegokolwiek na serwer.

Zmień rozmiar obrazu

Najczęstsze pytania

Jaka wartość CFG jest optymalna przy realistycznych obrazach?
W większości modeli wywodzących się ze Stable Diffusion najbardziej naturalny fotorealizm daje zakres od 4 do 6 — wyższe wartości tworzą plastikową skórę i przesadzony kontrast. We Fluksie, który korzysta z innej skali guidance, odpowiednikiem jest zwykle przedział od 2 do 4. Zawsze sprawdź zalecenia konkretnego modelu, zanim przyjmiesz jakąkolwiek wartość domyślną.
Czy ten sam seed daje ten sam obraz w różnych narzędziach?
Nie. Seed jest odtwarzalny wyłącznie w obrębie tego samego modelu, tej samej wersji i przy tych samych parametrach. Seed 12345 w SDXL nie ma nic wspólnego z seedem 12345 we Fluksie czy w Midjourney. Dlatego razem z liczbą trzeba zawsze zapisać model i wersję — sam seed nie niesie żadnej użytecznej informacji.
Czy zwiększanie liczby steps zawsze poprawia jakość obrazu?
Nie. Zysk jest bardzo duży mniej więcej do 25–30 kroków, a potem gwałtownie maleje. Powyżej 60 różnicy praktycznie nie widać, a powyżej 80 marnujesz wyłącznie czas obliczeń. Jeśli obraz ma problemy z anatomią albo brakuje w nim elementów, winowajcą jest prompt lub model, a nie liczba kroków.
Czym różni się stylize od chaos w Midjourney?
Stylize decyduje o tym, ile własnej estetyki model nałoży na Twoje polecenie, wpływając na światło, paletę i kompozycję każdego obrazu. Chaos steruje różnorodnością między czterema obrazami z jednej partii: przy wysokim chaosie dostajesz cztery mocno odmienne interpretacje tego samego promptu. Wysoki chaos przydaje się na etapie poszukiwań, niski wtedy, gdy znasz już kierunek.
Dlaczego na obrazie pojawiają się zdublowane osoby albo przedmioty?
Zwykle dzieje się tak przy bardzo skrajnych proporcjach albo przy rozdzielczości mocno przekraczającej tę, na której model był trenowany. Model próbuje wypełnić dodatkową przestrzeń, powielając elementy, które już rozpoznaje. Rozwiązaniem jest generowanie w proporcji bliższej kwadratowi lub 16:9, w natywnej rozdzielczości modelu, a następnie rozszerzenie techniką outpaintingu albo powiększenie przez upscale.
Jak sterować parametrami w ChatGPT albo Gemini, skoro nie udostępniają tych pól?
Te narzędzia ukrywają suwaki liczbowe i dobierają wartości same, więc sterowanie odbywa się językiem naturalnym w samym prompcie: wprost poproś o format, opisz oczekiwany poziom szczegółowości i zaznacz, czy chcesz bardziej dosłownego, czy bardziej artystycznego odczytania sceny. Jeśli praca wymaga dokładnej odtwarzalności, sięgnij po narzędzie udostępniające seed i CFG, na przykład ComfyUI, Automatic1111 albo Leonardo AI.