Tworzenie obrazów w ChatGPT przestało być funkcją poboczną i stało się jedną z rzeczy, które to narzędzie robi najlepiej. Od kwietnia 2026 generowanie opiera się na ChatGPT Images 2.0 — natywnym modelu, który ostatecznie zastąpił DALL·E, wycofanego w maju tego samego roku — i który rozwiązał najbardziej uporczywy problem generatorów obrazu: pisanie tekstu wewnątrz grafiki bez przekręcania liter.
To zmienia zakres tego, co da się zrobić. Plakat z czytelnym tytułem, infografika z poprawnymi liczbami, okładka z nazwą marki, strona komiksu z dialogami, makieta opakowania z etykietą — wcześniej wszystko to wychodziło krzywo, dziś w większości prób wygląda czysto.
Ten poradnik prowadzi przez całą drogę: pierwszą wygenerowaną grafikę, pisanie promptów w formie, którą ChatGPT rozumie najlepiej, poprawianie bez generowania wszystkiego od nowa, utrzymanie tej samej postaci na kilku obrazach, różnice między planem darmowym a płatnym oraz to, czego narzędzie wciąż nie robi dobrze.
Co się zmieniło w generowaniu obrazów w ChatGPT
Do 2025 roku ChatGPT tworzył obrazy, uruchamiając DALL·E jako osobny system: pisałeś polecenie, on przekładał je na wewnętrzny prompt i wysyłał do innego modelu. Wyniki bywały nierówne, bo po drodze następowało tłumaczenie, na które nie miałeś wpływu.
Dziś model obrazu jest natywny i dzieli kontekst z modelem językowym. W praktyce rozumie polecenie tak samo jak zwykłe pytanie: gdy napiszesz „zrób plakat dla kawiarni, która otwiera się o 7 rano w Krakowie”, nie musisz opisywać każdego elementu graficznego — sam wyprowadzi układ, hierarchię i treść.
Trzy praktyczne konsekwencje liczą się najbardziej:
- Tekst wewnątrz grafiki wreszcie działa. Tytuły, akapity, etykiety, podpisy, a nawet teksty w kilku językach wychodzą czytelnie. To była największa pięta achillesowa generatorów obrazu.
- Złożony układ jest osiągalny. Infografiki, rozkładówki, karty postaci i strony z wieloma kadrami przestały być kwestią szczęścia.
- Spójność między obrazami wyraźnie wzrosła. Da się wygenerować serię grafik z tą samą postacią albo tym samym produktem.
💡 Warto wiedzieć: limity generowania w planie darmowym nie są oficjalnie podawane i zmieniają się wraz z obciążeniem platformy. Każdą liczbę spotkaną w sieci traktuj jako szacunek, nie jako sztywną zasadę.
Jak wygenerować pierwszy obraz, krok po kroku
Ścieżka jest maksymalnie prosta — nie ma osobnego panelu ani obowiązkowej konfiguracji.
- Otwórz nową rozmowę. Nie musisz wybierać żadnego specjalnego trybu; wystarczy poprosić.
- Opisz obraz zwykłym językiem. Pisz tak, jakbyś tłumaczył grafikowi, pełnymi zdaniami. Nie używaj listy słów po przecinku: ten format pochodzi z innych narzędzi i tu daje słabsze efekty.
- Podaj proporcje. „Format pionowy pod relacje”, „kwadrat na Instagram”, „poziomy 16:9”. Jeśli nie powiesz, model wybierze sam.
- Poczekaj na wygenerowanie. Obrazy powstają dłużej niż odpowiedzi tekstowe, zwłaszcza te z gęstym układem.
- Poproś o poprawki w tej samej rozmowie. „Przyciemnij tło”, „powiększ tytuł”, „zmień kolor płaszcza na czerwony”. Model zachowa obraz i zmieni tylko to, o co poprosisz.
- Pobierz plik w pełnej rozdzielczości. Korzystaj z przycisku pobierania, a nie ze zrzutu ekranu — zrzut traci jakość i ma rozmiar twojego okna.
Ten ostatni punkt jest ważniejszy, niż się wydaje. Wiele osób zapisuje grafikę prawym przyciskiem z miniatury i zostaje z małym, ponownie skompresowanym plikiem.
Dwa tryby: natychmiastowy i z rozumowaniem
ChatGPT Images 2.0 pracuje w dwóch trybach, a zrozumienie różnicy oszczędza rozczarowań.
O Tryb natychmiastowy generuje wprost z twojego polecenia. Jest szybki, dostępny we wszystkich planach łącznie z darmowym i dobrze radzi sobie z prostymi grafikami: sceną, portretem, ilustracją, tłem.
O Tryb z rozumowaniem — tak zwany „thinking” — każe modelowi zaplanować pracę przed rysowaniem: sprawdza liczbę obiektów, weryfikuje twoje ograniczenia, porządkuje układ, a w razie potrzeby szuka w sieci aktualnych informacji do umieszczenia na grafice. To ten tryb daje poprawną infografikę, plakat z prawdziwymi danymi i kompozycję z wieloma wyrównanymi elementami. Jest zarezerwowany dla planów płatnych.
W praktyce: gdy polecenie dotyczy jednej sceny, wystarczy tryb natychmiastowy. Gdy pojawia się liczenie („dokładnie pięć ikon”), hierarchia tekstu albo dane, które muszą się zgadzać, rozumowanie robi realną różnicę.
Jak pisać prompty, które ChatGPT rozumie najlepiej
Tu leży największa różnica między ChatGPT a narzędziami pokroju Midjourney: on woli zdania niż listę tagów. Zapis „kobieta, 35 lat, szara marynarka, biuro, 85 mm, bokeh” zadziała, ale da mniej niż ta sama treść ujęta w zdania.
Zacznij od funkcji obrazu, nie od opisu
Podanie celu zmienia cały wynik. „Plakat promujący warsztaty fotograficzne 12 lipca” daje coś znacznie bardziej użytecznego niż „grafika z aparatem i tekstem”. Model wykorzystuje przeznaczenie, żeby ustalić hierarchię, rozłożenie i styl.
Napisz dokładny tekst w cudzysłowie
Gdy grafika ma zawierać słowa, zapisz je dosłownie i w cudzysłowie: tytuł „Śniadania”, podtytuł „w każdą sobotę, 8:00–11:00”. Bez cudzysłowu model może sparafrazować albo zmyślić. Powiedz też, gdzie każdy napis ma się znaleźć: u góry, w stopce, w prawym dolnym rogu.
Opisz strukturę przed stylem
Kolejność, która działa, to: co się pojawia i gdzie → dopiero potem jak wygląda. „Trzy równe kolumny, ikona na górze każdej, poniżej tytuł, a na dole krótki akapit; styl minimalistyczny, beżowe tło, bezszeryfowa typografia”. Struktura na początku oszczędza mnóstwo poprawek.
Jasno powiedz, czego nie chcesz
ChatGPT nie ma pola na prompt negatywny. Ograniczenie wpisujesz w samo polecenie i lepiej działa ono w formie twierdzącej: „czysta kompozycja, bez żadnego tekstu poza tytułem” daje więcej niż „bez tekstu”.
Poprawiaj, zamiast pisać od nowa
To największa zaleta interfejsu rozmowy. Gdy coś wyjdzie źle, nie pisz promptu od zera, tylko poproś o poprawkę. „Zostaw wszystko, ale zmień tło na granatowe” zachowuje to, co już było dobre. Przepisanie całego promptu tworzy nowy obraz bez związku z poprzednim.
💡 Przydatny skrót: poproś samego ChatGPT o ulepszenie promptu przed generowaniem. „Przepisz to polecenie jako szczegółowy prompt graficzny, na razie nic nie generuj” zwykle wydobywa szczegóły, o których nie pomyślałeś.
Proporcje i rozdzielczość: o co prosić
Model przyjmuje szeroki zakres formatów, od bardzo szerokich po bardzo wysokie, i generuje do 2K. Ustalenie proporcji przed generowaniem oszczędza późniejszego kadrowania, a kadrowanie zawsze kosztuje kompozycję.
| Przeznaczenie | Jak poprosić | Proporcje |
|---|---|---|
| Tablica na Instagramie | format kwadratowy | 1:1 |
| Tablica pionowa / portret | format portretowy na tablicę | 4:5 |
| Relacje i rolki | format pionowy pod relacje | 9:16 |
| Miniatura na YouTube | format poziomy panoramiczny | 16:9 |
| Baner na stronę | format szeroki panoramiczny | 3:1 |
| Okładka e-booka | format pionowy okładki książki | 2:3 |
| Tapeta na pulpit | format poziomy panoramiczny | 16:9 |
Jeśli potrzebujesz konkretnej rozdzielczości — na przykład 1920 na 1080 — wygeneruj obraz we właściwych proporcjach i dopasuj go później narzędziem Zmień rozmiar. Podawanie dokładnych wymiarów w pikselach wewnątrz promptu rzadko jest respektowane co do piksela.
Edycja obrazów: polecenia, które działają
To właśnie w edycji ChatGPT wygrywa z narzędziami czysto generatywnymi. Nie potrzebujesz maski, warstwy ani zaznaczenia — opisujesz zmianę słowami.
Zmiana jednego elementu
„Zostaw kompozycję bez zmian i zmień tylko kolor ściany na szałwiową zieleń”. Im wyraźniej powiesz, co ma zostać nietknięte, tym mniej model rusza resztę. Słowo „zostaw” robi tu zaskakująco dużo.
Dodawanie i usuwanie obiektów
„Usuń roślinę z prawego rogu i zostaw gładką ścianę”. Sprawdza się przy wyraźnie odgraniczonych obiektach. Usuwanie z obszarów o gęstej fakturze potrafi zostawić ślady — wtedy zwykle lepiej wygenerować scenę od nowa niż uparcie poprawiać.
Zmiana stylu przy zachowaniu sceny
„Ta sama kompozycja, te same elementy, ale w stylu akwareli”. Przydaje się do testowania różnych języków wizualnych bez utraty kadru, który już zaakceptowałeś.
Edycja własnego zdjęcia
Możesz wgrać własne zdjęcie i poprosić o zmiany: podmianę tła, korektę światła, zamianę w ilustrację, warianty. Pamiętaj jednak, że wynik to nowy obraz stworzony na podstawie twojego, a nie edycja oryginału piksel po pikselu.
Poszerzenie kadru
„Rozszerz ten obraz do formatu poziomego, kontynuując scenerię naturalnie po bokach”. To rozmowny odpowiednik techniki outpainting, która rozwiązuje klasyczny problem pionowej grafiki mającej stać się banerem.
Jak zachować tę samą postać na kilku obrazach
To był najtrudniejszy problem generatorów obrazu i dziś jest znacznie łatwiejszy. Trzy podejścia, od najprostszego do najpewniejszego.
Zostań w tej samej rozmowie. To najłatwiejsza i na co dzień najskuteczniejsza metoda. Po wygenerowaniu postaci poproś o kolejną scenę bez ponownego opisu: „a teraz pokaż tę samą postać siedzącą w kawiarni”. Model niesie kontekst rozmowy i zachowuje rysy.
Zapisz stały opis cech. Ułóż krótki, niezmienny opis — włosy, oczy, charakterystyczne ubranie, wyrazisty dodatek — i powtarzaj dokładnie te same słowa w każdym poleceniu. Synonimy przeszkadzają: „beżowy płaszcz” i „palto w kolorze piasku” dadzą dwa różne ubrania.
Poproś najpierw o arkusz referencyjny. Wygeneruj kartę postaci z tą samą twarzą w kilku ujęciach i wyrazach, a potem używaj jej jako referencji przy kolejnych obrazach. To najbardziej pracochłonna i najbardziej konsekwentna droga, zwłaszcza przy dłuższych seriach.
Ta sama logika działa przy produktach i identyfikacji marki: im bardziej stały opis, tym stabilniejszy wynik.
Darmowy czy płatny: co naprawdę się zmienia
Generowanie obrazów działa we wszystkich planach, także w darmowym. Różnią się wolumen, szybkość i dostęp do trybu z rozumowaniem.
| Element | Plan darmowy | Plany płatne |
|---|---|---|
| Generowanie obrazu | Dostępne, tryb natychmiastowy | Dostępne, natychmiastowy i z rozumowaniem |
| Wolumen | Ograniczony, limit nieujawniony | Znacznie wyższy |
| Szybkość | Niższa, z kolejką | Priorytet w godzinach szczytu |
| Wyszukiwanie w sieci podczas generowania | Nie | Tak, w trybie z rozumowaniem |
| Złożone układy i infografiki | Nierówny efekt | Znacznie pewniejszy |
| Spójne serie obrazów | Ograniczone | Tak |
Do okazjonalnego użytku prywatnego — tapeta, ilustracja do posta, grafika pomocnicza — plan darmowy w zupełności wystarcza. Przy stałej pracy z układem, tekstem i większą liczbą plików różnica ujawnia się szybko. Jeśli chcesz porównać opcje przed wykupieniem, przewodnik po najlepszych AI do tworzenia obrazów zestawia najważniejsze nazwy obok siebie, a poradnik o tworzeniu obrazów w Gemini omawia główną alternatywę.
Czego ChatGPT wciąż nie robi dobrze
Znajomość ograniczeń oszczędza czas. Żadne z nich nie wynika ze złego promptu — to granice samego narzędzia.
- Prawdziwe osoby. Tworzenie wizerunków rozpoznawalnych osób, zwłaszcza publicznych, jest zablokowane. Przeformułowanie polecenia nic nie da.
- Marki i licencjonowane postacie. Logotypy istniejących firm i postacie chronione prawem autorskim również są odrzucane.
- Prawdziwy wektor. Wynik zawsze jest rastrowy, w pikselach. Gdy potrzebujesz pliku edytowalnego na krzywych, grafika posłuży jako wzór do przerysowania, a nie jako plik końcowy.
- Pewna przezroczystość tła. Nawet po wyraźnej prośbie obraz zwykle ma jednolite tło. Szybciej załatwić przezroczystość później, usuwając tło.
- Rozdzielczość powyżej 2K. Do dużego druku albo monitora 4K trzeba powiększyć obraz po wygenerowaniu.
- Wierne odtworzenie twojego zdjęcia. Przy edycji wgranego pliku model tworzy scenę na nowo. Drobne detale oryginału się zmieniają.
Siedem błędów, które szkodzą najbardziej
- Pisanie w formie tagów. Lista słów po przecinku to język innych narzędzi. Tutaj lepiej sprawdzają się zdania.
- Pominięcie proporcji. Bez wskazówki model wybierze sam — i prawie zawsze wybierze format nieodpowiedni do twojego celu.
- Przepisywanie promptu przy każdej próbie. Tracisz to, co już wyszło dobrze. Proś o punktowe poprawki.
- Zostawianie tekstu bez cudzysłowu. Bez cudzysłowu i bez wskazania miejsca model parafrazuje napis albo wstawia go, gdzie chce.
- Zapisywanie zrzutem ekranu. Traci rozdzielczość i dokłada kompresję. Używaj pobierania.
- Proszenie o wszystko naraz. Prompty z dziesięcioma wymaganiami zwykle zawodzą w dwóch albo trzech. Wygeneruj bazę i poprawiaj etapami.
- Publikowanie bez optymalizacji. Grafika 2K w PNG waży kilka megabajtów i potrafi położyć ładowanie każdej strony.
Co zrobić z obrazem po wygenerowaniu
Ten ostatni punkt zasługuje na rozwinięcie, bo tu myli się najwięcej osób. Obraz wychodzący z ChatGPT jest gotowy do obejrzenia, a nie do publikacji.
Zamień na właściwy format. PNG świetnie radzi sobie z przezroczystością i fatalnie ze zdjęciami w sieci. Na stronę WebP zwykle zbija wagę o połowę bez widocznej różnicy, a do zwykłej wysyłki wystarczy JPG. Narzędzie Konwertuj zrobi konwersję wprost w przeglądarce, a przewodnik po formatach obrazów pomoże wybrać.
Zbij wagę pliku. Grafika 2K potrafi przekroczyć 5 MB. Narzędzie Kompresuj zetnie sporą część bez widocznej straty, a przy naprawdę ciężkich plikach instrukcja jak zmniejszyć obraz z MB do KB opisuje szczegóły.
W razie potrzeby wytnij obiekt. Przy logo, produktach i elementach lądujących na kolorowym tle brakującym krokiem jest Usuń tło i zapis w przezroczystym PNG.
Dopasuj rozdzielczość i kadr. Jeśli obraz wyszedł mniejszy, niż potrzeba, możesz zwiększyć rozdzielczość bez utraty jakości. Jeśli proporcje są nietrafione, Kadrowanie obrazu zachowa więcej niż rozciąganie.
Wykorzystaj paletę. Aby utrzymać spójność wizualną między obrazami z różnych sesji, użyj Wyodrębnij kolory na tym najlepszym i przywołaj te odcienie w kolejnych promptach.
💡 Kolejność, która działa: pobierz w pełnej rozdzielczości → przytnij lub przeskaluj → zmień format → kompresuj na końcu. Kompresja przed skalowaniem marnuje jakość.
Trzy przykłady pełnych poleceń
Na koniec trzy polecenia napisane w formie, którą ChatGPT wykorzystuje najlepiej — zwróć uwagę, że każde podaje cel, dokładny tekst i proporcje. Prompty zapisujemy po angielsku, bo modele graficzne rozumieją ten język najpewniej.
Lista kontrolna przed generowaniem
- Czy powiedziałeś, do czego obraz służy, a nie tylko co przedstawia?
- Czy proporcje są podane?
- Czy tekst, który ma się pojawić, jest w cudzysłowie i ma wskazane miejsce?
- Czy struktura została opisana przed stylem?
- Czy ograniczenia są zapisane w formie twierdzącej?
- Czy prosisz o poprawkę zamiast przepisywać całość?
- Czy pobierzesz plik w pełnej rozdzielczości, a nie zrzutem ekranu?
Przygotuj swoje grafiki do publikacji
Grafiki w 2K łatwo przekraczają 5 MB. Zbij wagę bez widocznej straty jakości, prosto w przeglądarce.
Skompresuj obraz