Tworzenie obrazów w ChatGPT przestało być funkcją poboczną i stało się jedną z rzeczy, które to narzędzie robi najlepiej. Od kwietnia 2026 generowanie opiera się na ChatGPT Images 2.0 — natywnym modelu, który ostatecznie zastąpił DALL·E, wycofanego w maju tego samego roku — i który rozwiązał najbardziej uporczywy problem generatorów obrazu: pisanie tekstu wewnątrz grafiki bez przekręcania liter.

To zmienia zakres tego, co da się zrobić. Plakat z czytelnym tytułem, infografika z poprawnymi liczbami, okładka z nazwą marki, strona komiksu z dialogami, makieta opakowania z etykietą — wcześniej wszystko to wychodziło krzywo, dziś w większości prób wygląda czysto.

Ten poradnik prowadzi przez całą drogę: pierwszą wygenerowaną grafikę, pisanie promptów w formie, którą ChatGPT rozumie najlepiej, poprawianie bez generowania wszystkiego od nowa, utrzymanie tej samej postaci na kilku obrazach, różnice między planem darmowym a płatnym oraz to, czego narzędzie wciąż nie robi dobrze.

Co się zmieniło w generowaniu obrazów w ChatGPT

Do 2025 roku ChatGPT tworzył obrazy, uruchamiając DALL·E jako osobny system: pisałeś polecenie, on przekładał je na wewnętrzny prompt i wysyłał do innego modelu. Wyniki bywały nierówne, bo po drodze następowało tłumaczenie, na które nie miałeś wpływu.

Dziś model obrazu jest natywny i dzieli kontekst z modelem językowym. W praktyce rozumie polecenie tak samo jak zwykłe pytanie: gdy napiszesz „zrób plakat dla kawiarni, która otwiera się o 7 rano w Krakowie”, nie musisz opisywać każdego elementu graficznego — sam wyprowadzi układ, hierarchię i treść.

Trzy praktyczne konsekwencje liczą się najbardziej:

💡 Warto wiedzieć: limity generowania w planie darmowym nie są oficjalnie podawane i zmieniają się wraz z obciążeniem platformy. Każdą liczbę spotkaną w sieci traktuj jako szacunek, nie jako sztywną zasadę.

Jak wygenerować pierwszy obraz, krok po kroku

Ścieżka jest maksymalnie prosta — nie ma osobnego panelu ani obowiązkowej konfiguracji.

  1. Otwórz nową rozmowę. Nie musisz wybierać żadnego specjalnego trybu; wystarczy poprosić.
  2. Opisz obraz zwykłym językiem. Pisz tak, jakbyś tłumaczył grafikowi, pełnymi zdaniami. Nie używaj listy słów po przecinku: ten format pochodzi z innych narzędzi i tu daje słabsze efekty.
  3. Podaj proporcje. „Format pionowy pod relacje”, „kwadrat na Instagram”, „poziomy 16:9”. Jeśli nie powiesz, model wybierze sam.
  4. Poczekaj na wygenerowanie. Obrazy powstają dłużej niż odpowiedzi tekstowe, zwłaszcza te z gęstym układem.
  5. Poproś o poprawki w tej samej rozmowie. „Przyciemnij tło”, „powiększ tytuł”, „zmień kolor płaszcza na czerwony”. Model zachowa obraz i zmieni tylko to, o co poprosisz.
  6. Pobierz plik w pełnej rozdzielczości. Korzystaj z przycisku pobierania, a nie ze zrzutu ekranu — zrzut traci jakość i ma rozmiar twojego okna.

Ten ostatni punkt jest ważniejszy, niż się wydaje. Wiele osób zapisuje grafikę prawym przyciskiem z miniatury i zostaje z małym, ponownie skompresowanym plikiem.

Dwa tryby: natychmiastowy i z rozumowaniem

ChatGPT Images 2.0 pracuje w dwóch trybach, a zrozumienie różnicy oszczędza rozczarowań.

O Tryb natychmiastowy generuje wprost z twojego polecenia. Jest szybki, dostępny we wszystkich planach łącznie z darmowym i dobrze radzi sobie z prostymi grafikami: sceną, portretem, ilustracją, tłem.

O Tryb z rozumowaniem — tak zwany „thinking” — każe modelowi zaplanować pracę przed rysowaniem: sprawdza liczbę obiektów, weryfikuje twoje ograniczenia, porządkuje układ, a w razie potrzeby szuka w sieci aktualnych informacji do umieszczenia na grafice. To ten tryb daje poprawną infografikę, plakat z prawdziwymi danymi i kompozycję z wieloma wyrównanymi elementami. Jest zarezerwowany dla planów płatnych.

W praktyce: gdy polecenie dotyczy jednej sceny, wystarczy tryb natychmiastowy. Gdy pojawia się liczenie („dokładnie pięć ikon”), hierarchia tekstu albo dane, które muszą się zgadzać, rozumowanie robi realną różnicę.

Jak pisać prompty, które ChatGPT rozumie najlepiej

Tu leży największa różnica między ChatGPT a narzędziami pokroju Midjourney: on woli zdania niż listę tagów. Zapis „kobieta, 35 lat, szara marynarka, biuro, 85 mm, bokeh” zadziała, ale da mniej niż ta sama treść ujęta w zdania.

Zacznij od funkcji obrazu, nie od opisu

Podanie celu zmienia cały wynik. „Plakat promujący warsztaty fotograficzne 12 lipca” daje coś znacznie bardziej użytecznego niż „grafika z aparatem i tekstem”. Model wykorzystuje przeznaczenie, żeby ustalić hierarchię, rozłożenie i styl.

Napisz dokładny tekst w cudzysłowie

Gdy grafika ma zawierać słowa, zapisz je dosłownie i w cudzysłowie: tytuł „Śniadania”, podtytuł „w każdą sobotę, 8:00–11:00”. Bez cudzysłowu model może sparafrazować albo zmyślić. Powiedz też, gdzie każdy napis ma się znaleźć: u góry, w stopce, w prawym dolnym rogu.

Opisz strukturę przed stylem

Kolejność, która działa, to: co się pojawia i gdzie → dopiero potem jak wygląda. „Trzy równe kolumny, ikona na górze każdej, poniżej tytuł, a na dole krótki akapit; styl minimalistyczny, beżowe tło, bezszeryfowa typografia”. Struktura na początku oszczędza mnóstwo poprawek.

Jasno powiedz, czego nie chcesz

ChatGPT nie ma pola na prompt negatywny. Ograniczenie wpisujesz w samo polecenie i lepiej działa ono w formie twierdzącej: „czysta kompozycja, bez żadnego tekstu poza tytułem” daje więcej niż „bez tekstu”.

Poprawiaj, zamiast pisać od nowa

To największa zaleta interfejsu rozmowy. Gdy coś wyjdzie źle, nie pisz promptu od zera, tylko poproś o poprawkę. „Zostaw wszystko, ale zmień tło na granatowe” zachowuje to, co już było dobre. Przepisanie całego promptu tworzy nowy obraz bez związku z poprzednim.

💡 Przydatny skrót: poproś samego ChatGPT o ulepszenie promptu przed generowaniem. „Przepisz to polecenie jako szczegółowy prompt graficzny, na razie nic nie generuj” zwykle wydobywa szczegóły, o których nie pomyślałeś.

Proporcje i rozdzielczość: o co prosić

Model przyjmuje szeroki zakres formatów, od bardzo szerokich po bardzo wysokie, i generuje do 2K. Ustalenie proporcji przed generowaniem oszczędza późniejszego kadrowania, a kadrowanie zawsze kosztuje kompozycję.

PrzeznaczenieJak poprosićProporcje
Tablica na Instagramieformat kwadratowy1:1
Tablica pionowa / portretformat portretowy na tablicę4:5
Relacje i rolkiformat pionowy pod relacje9:16
Miniatura na YouTubeformat poziomy panoramiczny16:9
Baner na stronęformat szeroki panoramiczny3:1
Okładka e-bookaformat pionowy okładki książki2:3
Tapeta na pulpitformat poziomy panoramiczny16:9

Jeśli potrzebujesz konkretnej rozdzielczości — na przykład 1920 na 1080 — wygeneruj obraz we właściwych proporcjach i dopasuj go później narzędziem Zmień rozmiar. Podawanie dokładnych wymiarów w pikselach wewnątrz promptu rzadko jest respektowane co do piksela.

Edycja obrazów: polecenia, które działają

To właśnie w edycji ChatGPT wygrywa z narzędziami czysto generatywnymi. Nie potrzebujesz maski, warstwy ani zaznaczenia — opisujesz zmianę słowami.

Zmiana jednego elementu

„Zostaw kompozycję bez zmian i zmień tylko kolor ściany na szałwiową zieleń”. Im wyraźniej powiesz, co ma zostać nietknięte, tym mniej model rusza resztę. Słowo „zostaw” robi tu zaskakująco dużo.

Dodawanie i usuwanie obiektów

„Usuń roślinę z prawego rogu i zostaw gładką ścianę”. Sprawdza się przy wyraźnie odgraniczonych obiektach. Usuwanie z obszarów o gęstej fakturze potrafi zostawić ślady — wtedy zwykle lepiej wygenerować scenę od nowa niż uparcie poprawiać.

Zmiana stylu przy zachowaniu sceny

„Ta sama kompozycja, te same elementy, ale w stylu akwareli”. Przydaje się do testowania różnych języków wizualnych bez utraty kadru, który już zaakceptowałeś.

Edycja własnego zdjęcia

Możesz wgrać własne zdjęcie i poprosić o zmiany: podmianę tła, korektę światła, zamianę w ilustrację, warianty. Pamiętaj jednak, że wynik to nowy obraz stworzony na podstawie twojego, a nie edycja oryginału piksel po pikselu.

Poszerzenie kadru

„Rozszerz ten obraz do formatu poziomego, kontynuując scenerię naturalnie po bokach”. To rozmowny odpowiednik techniki outpainting, która rozwiązuje klasyczny problem pionowej grafiki mającej stać się banerem.

Jak zachować tę samą postać na kilku obrazach

To był najtrudniejszy problem generatorów obrazu i dziś jest znacznie łatwiejszy. Trzy podejścia, od najprostszego do najpewniejszego.

Zostań w tej samej rozmowie. To najłatwiejsza i na co dzień najskuteczniejsza metoda. Po wygenerowaniu postaci poproś o kolejną scenę bez ponownego opisu: „a teraz pokaż tę samą postać siedzącą w kawiarni”. Model niesie kontekst rozmowy i zachowuje rysy.

Zapisz stały opis cech. Ułóż krótki, niezmienny opis — włosy, oczy, charakterystyczne ubranie, wyrazisty dodatek — i powtarzaj dokładnie te same słowa w każdym poleceniu. Synonimy przeszkadzają: „beżowy płaszcz” i „palto w kolorze piasku” dadzą dwa różne ubrania.

Poproś najpierw o arkusz referencyjny. Wygeneruj kartę postaci z tą samą twarzą w kilku ujęciach i wyrazach, a potem używaj jej jako referencji przy kolejnych obrazach. To najbardziej pracochłonna i najbardziej konsekwentna droga, zwłaszcza przy dłuższych seriach.

Ta sama logika działa przy produktach i identyfikacji marki: im bardziej stały opis, tym stabilniejszy wynik.

Darmowy czy płatny: co naprawdę się zmienia

Generowanie obrazów działa we wszystkich planach, także w darmowym. Różnią się wolumen, szybkość i dostęp do trybu z rozumowaniem.

ElementPlan darmowyPlany płatne
Generowanie obrazuDostępne, tryb natychmiastowyDostępne, natychmiastowy i z rozumowaniem
WolumenOgraniczony, limit nieujawnionyZnacznie wyższy
SzybkośćNiższa, z kolejkąPriorytet w godzinach szczytu
Wyszukiwanie w sieci podczas generowaniaNieTak, w trybie z rozumowaniem
Złożone układy i infografikiNierówny efektZnacznie pewniejszy
Spójne serie obrazówOgraniczoneTak

Do okazjonalnego użytku prywatnego — tapeta, ilustracja do posta, grafika pomocnicza — plan darmowy w zupełności wystarcza. Przy stałej pracy z układem, tekstem i większą liczbą plików różnica ujawnia się szybko. Jeśli chcesz porównać opcje przed wykupieniem, przewodnik po najlepszych AI do tworzenia obrazów zestawia najważniejsze nazwy obok siebie, a poradnik o tworzeniu obrazów w Gemini omawia główną alternatywę.

Czego ChatGPT wciąż nie robi dobrze

Znajomość ograniczeń oszczędza czas. Żadne z nich nie wynika ze złego promptu — to granice samego narzędzia.

Siedem błędów, które szkodzą najbardziej

  1. Pisanie w formie tagów. Lista słów po przecinku to język innych narzędzi. Tutaj lepiej sprawdzają się zdania.
  2. Pominięcie proporcji. Bez wskazówki model wybierze sam — i prawie zawsze wybierze format nieodpowiedni do twojego celu.
  3. Przepisywanie promptu przy każdej próbie. Tracisz to, co już wyszło dobrze. Proś o punktowe poprawki.
  4. Zostawianie tekstu bez cudzysłowu. Bez cudzysłowu i bez wskazania miejsca model parafrazuje napis albo wstawia go, gdzie chce.
  5. Zapisywanie zrzutem ekranu. Traci rozdzielczość i dokłada kompresję. Używaj pobierania.
  6. Proszenie o wszystko naraz. Prompty z dziesięcioma wymaganiami zwykle zawodzą w dwóch albo trzech. Wygeneruj bazę i poprawiaj etapami.
  7. Publikowanie bez optymalizacji. Grafika 2K w PNG waży kilka megabajtów i potrafi położyć ładowanie każdej strony.

Co zrobić z obrazem po wygenerowaniu

Ten ostatni punkt zasługuje na rozwinięcie, bo tu myli się najwięcej osób. Obraz wychodzący z ChatGPT jest gotowy do obejrzenia, a nie do publikacji.

Zamień na właściwy format. PNG świetnie radzi sobie z przezroczystością i fatalnie ze zdjęciami w sieci. Na stronę WebP zwykle zbija wagę o połowę bez widocznej różnicy, a do zwykłej wysyłki wystarczy JPG. Narzędzie Konwertuj zrobi konwersję wprost w przeglądarce, a przewodnik po formatach obrazów pomoże wybrać.

Zbij wagę pliku. Grafika 2K potrafi przekroczyć 5 MB. Narzędzie Kompresuj zetnie sporą część bez widocznej straty, a przy naprawdę ciężkich plikach instrukcja jak zmniejszyć obraz z MB do KB opisuje szczegóły.

W razie potrzeby wytnij obiekt. Przy logo, produktach i elementach lądujących na kolorowym tle brakującym krokiem jest Usuń tło i zapis w przezroczystym PNG.

Dopasuj rozdzielczość i kadr. Jeśli obraz wyszedł mniejszy, niż potrzeba, możesz zwiększyć rozdzielczość bez utraty jakości. Jeśli proporcje są nietrafione, Kadrowanie obrazu zachowa więcej niż rozciąganie.

Wykorzystaj paletę. Aby utrzymać spójność wizualną między obrazami z różnych sesji, użyj Wyodrębnij kolory na tym najlepszym i przywołaj te odcienie w kolejnych promptach.

💡 Kolejność, która działa: pobierz w pełnej rozdzielczości → przytnij lub przeskaluj → zmień format → kompresuj na końcu. Kompresja przed skalowaniem marnuje jakość.

Trzy przykłady pełnych poleceń

Na koniec trzy polecenia napisane w formie, którą ChatGPT wykorzystuje najlepiej — zwróć uwagę, że każde podaje cel, dokładny tekst i proporcje. Prompty zapisujemy po angielsku, bo modele graficzne rozumieją ten język najpewniej.

Create a vertical promotional poster for a photography workshop. The title should read "Natural Light" in large letters at the top, and below it, smaller, "Saturday, July 12 — 2pm to 6pm". Earthy-toned background with a thin-line camera silhouette. Minimalist style, sans-serif typography, plenty of empty space. Vertical format for stories.
Generate a horizontal infographic with three equal columns explaining the steps of a process. Each column has a simple icon at the top, a short title and a supporting sentence. The titles are "Collect", "Analyze" and "Publish". Palette of navy blue, white and an orange accent. Clean editorial style, no shadows. Widescreen format.
Create a square product photo of a matte white cream jar on light stone, with fresh green leaves around it and a soft beige background. Diffused natural light coming from the left, frontal close-up, clean skincare aesthetic. No text anywhere in the image.

Lista kontrolna przed generowaniem

Przygotuj swoje grafiki do publikacji

Grafiki w 2K łatwo przekraczają 5 MB. Zbij wagę bez widocznej straty jakości, prosto w przeglądarce.

Skompresuj obraz

Najczęstsze pytania

Czy da się tworzyć obrazy w darmowym ChatGPT?
Tak. Generowanie obrazów działa we wszystkich planach, także w darmowym, w trybie natychmiastowym. Różnią się dozwolony wolumen, szybkość w godzinach szczytu i dostęp do trybu z rozumowaniem, zarezerwowanego dla planów płatnych. OpenAI nie podaje dokładnej liczby obrazów w planie darmowym, a limit zmienia się wraz z obciążeniem platformy — każdą konkretną liczbę spotkaną w sieci traktuj więc jako szacunek.
Czy ChatGPT nadal korzysta z DALL·E?
Nie. Od kwietnia 2026 obrazy powstają w ChatGPT Images 2.0 — natywnym modelu wbudowanym w samego ChatGPT. DALL·E 2 i DALL·E 3 wycofano w maju 2026. Różnica w praktyce jest duża: model obrazu dzieli kontekst z modelem językowym, więc rozumie polecenie wprost, bez pośredniego etapu tłumaczenia, który wcześniej powodował nierówne wyniki.
Dlaczego tekst na mojej grafice wyszedł błędnie?
Dwie przyczyny wyjaśniają niemal wszystkie przypadki. Pierwsza to brak cudzysłowu: bez niego model traktuje słowo jak temat i może je sparafrazować. Druga to nadmiar tekstu — długie, gęste akapity wciąż mylą się częściej niż tytuły i krótkie zdania. Jeśli tekst jest kluczowy, a wciąż wychodzi źle, najpewniejsze jest wygenerowanie grafiki bez napisów i dodanie ich później w edytorze.
Jaka jest maksymalna rozdzielczość obrazów?
Model generuje do 2K, w szerokim zakresie proporcji — od bardzo szerokich po bardzo wysokie. Do zastosowań cyfrowych to w zupełności wystarcza: social media, strona, prezentacja, miniatura. Do dużego druku albo tapety na monitor 4K trzeba powiększyć obraz po wygenerowaniu, co dobrze wychodzi przy czystych, mało zagęszczonych kompozycjach.
Czy mogę wykorzystywać wygenerowane obrazy komercyjnie?
Regulamin OpenAI dopuszcza komercyjne wykorzystanie obrazów, które tworzysz, ale zasady bywają zmieniane i różnią się zależnie od planu i kraju. Poza tym prawo do użycia to nie to samo co ochrona prawna: w wielu jurysdykcjach dzieła powstałe w całości maszynowo napotykają ograniczenia w zakresie praw autorskich. Zanim użyjesz grafiki w materiale dla klienta albo w produkcie na sprzedaż, sprawdź aktualny regulamin i unikaj poleceń dotyczących znaków towarowych, licencjonowanych postaci i prawdziwych osób.
Jak sprawić, żeby ChatGPT wygenerował obraz z przezroczystym tłem?
Nawet przy wyraźnej prośbie efekt zwykle ma jednolite tło zamiast prawdziwej przezroczystości. Najszybciej poprosić o gładkie białe tło, które najłatwiej wyciąć, i zrobić przezroczystość później, usuwając tło i zapisując plik w PNG. Zajmuje to kilka sekund i wychodzi czyściej niż uparte proszenie modelu, który potrafi narysować szachownicę udającą przezroczystość.