Skip to main content
OpenAI Images Generations API stöder för närvarande flera bildgenereringsmodeller, inklusive den klassiska dall-e-3, den textrenderande gpt-image-1 med starkare förmåga, den senaste generationen gpt-image-2, samt nano-banana / nano-banana-2 / nano-banana-pro serien som nås via samma gränssnitt. Alla kan generera högkvalitativa bilder baserat på textbeskrivningar. Detta dokument beskriver huvudsakligen användningsprocessen för OpenAI Images Generations API, som gör det enkelt att använda OpenAI-seriens bildgenereringsfunktioner.

Ansökningsprocess

För att använda OpenAI Images Generations API kan du först gå till sidan OpenAI Images Generations API och klicka på knappen “Acquire” för att få de nödvändiga autentiseringsuppgifterna: Om du inte är inloggad eller registrerad kommer du automatiskt att omdirigeras till inloggningssidan där du kan registrera dig och logga in. Efter inloggning återvänder du automatiskt till denna sida. Vid första ansökan får du en gratis kvot som gör att du kan använda API:et kostnadsfritt.

GPT-Image-2 Modell

gpt-image-2 är OpenAIs nya generation av bildgenereringsmodell, som jämfört med dall-e-3 och gpt-image-1 har tydliga förbättringar inom följande områden:
  • Starkare efterlevnad av instruktioner: Kan exakt förstå komplexa kompositioner, räkning, positionsrelationer och andra strukturerade instruktioner.
  • Klarare textrendering: Engelska och siffror i affischer, menyer, infografik och logotyper visas nästan utan fel.
  • Rikare stiluttryck: Stödjer ursprungligen flera stilar såsom filmiska porträtt, retroaffischer, barnillustrationer, produktfotografi och infografik.
  • Inbyggt stöd för flera proportioner + hög upplösning: Täcker 5 proportioner (1:1, 4:3, 3:4, 16:9, 9:16) med 3 upplösningsnivåer (1K / 2K / 4K).
Anropssättet är helt identiskt med andra modeller, du behöver bara sätta fältet model till gpt-image-2. I returvärdet är url en permanent bildlänk hostad på platform.cdn.acedata.cloud, som kan öppnas direkt i webbläsare eller bäddas in på webbsidor.

Stödda size värden

gpt-image-2 kontrollerar endast formatet på size. Så länge det inte är auto eller en tom sträng måste det matcha WIDTHxHEIGHT (t.ex. 1024x1024, 2048x1152, 800x600); andra format ger 400-fel. Alla storlekar (1K / 2K / 4K / anpassade) debiteras per bild, ingen extra kostnad för storlek. Upstream har hårda begränsningar för anpassade storlekar: bredd och höjd måste vara multiplar av 16, längsta sidan ≤ 3840, total pixelantal ≤ 8,294,400. Överskrids detta avvisas förfrågan med 4xx.
Du kan också ange size: "auto" eller utelämna size-fältet, då väljer modellen standardstorlek själv. Vid 1K-nivå garanteras inte strikt pixeljustering — om du skickar 1024x1024 kan du få 1254x1254, proportionen bibehålls. Om du skickar tillbaka denna som size ändras inte debiteringen. 4K-anrop tar vanligtvis 4–8 minuter, rekommenderas att använda callback_url för asynkron återkoppling.
Om n-parametern gpt-image-2 stöder för närvarande inte n > 1: denna parameter ignoreras tyst, oavsett om du skickar n=1 eller n=10 returneras bara en bild per anrop och debiteras för en bild. Om du behöver flera bilder samtidigt, gör flera parallella anrop (helst med olika prompt eller seed, annars kan bilderna bli mycket lika). Samma begränsning gäller för gpt-image-1 / gpt-image-1.5 samt nano-banana / nano-banana-2 / nano-banana-pro. dall-e-2 är för närvarande den enda modellen som inbyggt stödjer n > 1; dall-e-3 stödjer endast n = 1.
Nedan visas några verkliga exempel för att intuitivt visa gpt-image-2 kapacitet.

Scenario 1: Filmiskt porträtt

I prompten kan du använda filmtermer (35mm film, kort skärpedjup, neonljus etc.) för att exakt styra atmosfär och känsla. Python-exempel:
Returvärde:
Genererad bild:

Scenario 2: Retro reseaffisch (med textrendering)

gpt-image-2 är stabil i typografi och layout, perfekt för affischer, menyer, gratulationskort med text.
Bild från url i returvärdet:

Modellen återger tydligt Art Deco-stilen och texten AMALFI och ITALIA 1958 är korrekt och klart renderad.

Scenario 3: Komplex komposition och räkning

Denna prompt testar modellens förmåga att följa strukturerade instruktioner om antal och position.
Genererad bild:

Antalet böcker (1 / 3 / 7) på de tre hyllorna stämmer helt med prompten, något som var svårt att uppnå stabilt under dall-e-3-eran.

Scenario 4: Illustrationsstil (landskapsformat)

Genom att specificera konstnärligt medium och stämningsord kan modellen generera stiliserade illustrationer.
Genererad landskapsillustration:

Asynkron och callback

gpt-image-2 tar vanligtvis 60–90 sekunder per anrop. Om du inte vill hålla en lång anslutning kan du använda callback_url-mekanismen för asynkron återkoppling. Anropsflödet är identiskt med andra modeller.

Nano Banana Serien

nano-banana serien är bildgenereringsmodeller baserade på Gemini, tillgängliga via samma /openai/images/generations-endpoint utan att byta endpoint, bara ändra model till någon av nedanstående:
Viktigt: stödda parametrar Nano Banana använder en adapter för OpenAI-protokollet och stöder endast följande parametrar jämfört med gpt-image-*: model, prompt, size.
  • size mappas enligt tabell nedan till intern aspect_ratio; ej listade storlekar faller tillbaka till 1:1:
    • 1024x1024 / 512x512 / 256x2561:1
    • 1792x102416:9
    • 1024x17929:16
  • Stöder inte n, quality, style, response_format, background, output_format; dessa ignoreras om angivna.
  • Returformat följer OpenAI-standard (data[].url), men created är alltid 0, b64_json returneras inte, och revised_prompt är alltid lika med original prompt.

Grundläggande anrop

Returvärde:
Genererad bild kan nås direkt via url:

Uppgradera till flaggskeppsmodellen nano-banana-pro

Byt bara model till nano-banana-pro, övriga parametrar är oförändrade:
Exempel på retur:

Asynkron callback

callback_url-mekanismen fungerar även för nano-banana, anropsflödet är identiskt med andra modeller, se avsnittet Asynkron callback nedan.

Grundläggande användning

Du kan fylla i motsvarande fält i gränssnittet, som visas nedan:

Vid första användningen behöver du minst fylla i tre fält: authorization väljs direkt från dropdown-menyn, model som är den OpenAI DALL-E modellkategori du vill använda (här finns huvudsakligen en modell, se våra modeller för detaljer), och prompt som är texten för bildgenerering. Till höger visas motsvarande genererade anropskod som du kan kopiera och köra, eller testa direkt med knappen “Try”.

Python-exempel:
Returvärde:
Returvärdet innehåller flera fält:
  • created: ID för bildgenereringsuppdraget, unikt för denna uppgift.
  • data: innehåller bildgenereringsresultatet.
I data finns detaljer om genererad bild, där url är bildens detaljlänk, som visas nedan:

Bildkvalitetsparameter quality

Här beskrivs hur du ställer in detaljerade parametrar för bildgenerering, där quality har två värden: standard för standardbild och hd för bild med finare detaljer och högre konsistens. Exempel på inställning av quality till standard:

Till höger visas motsvarande anropskod som kan kopieras eller testas direkt.

Python-exempel:
Returvärde:
Resultatet är liknande grundanvändningen, bilden med quality satt till standard visas nedan:

Samma anrop med quality satt till hd ger bilden nedan:

hd-bilden har finare detaljer och högre konsistens än standard.

Bildstorleksparameter size

Du kan också ange bildens storlek. Exempel med size satt till 1024x1024:

Till höger visas motsvarande kod som kan kopieras eller testas.

Python-exempel:
Returvärde:
Bild med storlek 1024x1024 visas nedan:

Samma anrop med storlek 1792x1024 ger följande bild: Storleken är tydligt annorlunda. Fler storlekar finns, se vår officiella dokumentation.

Bildstilsparameter style

style har två värden: vivid för mer livfulla bilder och natural för mer naturliga bilder. Exempel med style satt till vivid:

Till höger visas anropskod som kan kopieras eller testas.

Python-exempel:
Returvärde:
Bild med style satt till vivid visas nedan:

Samma anrop med style satt till natural ger följande bild:

vivid ger mer levande och realistiska bilder än natural.

Bildlänkens formatparameter response_format

Den sista parametern response_format har två värden: b64_json som kodar bilden i Base64, och url som är en vanlig bildlänk. Exempel med response_format satt till url:

Till höger visas anropskod som kan kopieras eller testas.

Python-exempel:
Returvärde:
Bildlänken med response_format satt till url är direkt åtkomlig, bilden visas nedan:

Samma anrop med response_format satt till b64_json ger Base64-kodad bild enligt nedan:

Asynkron callback

Eftersom bildgenerering kan ta tid och API-förfrågan kan hålla anslutningen öppen och belasta systemresurser, stödjer API:et asynkron callback. Flödet är: klienten skickar med callback_url i förfrågan, API returnerar omedelbart ett svar med task_id som identifierar uppgiften. När uppgiften är klar skickar API en POST med JSON till callback_url med samma task_id för att koppla ihop resultatet. Exempel: Webhook callback är en HTTP-tjänst som kan ta emot förfrågningar. Byt ut URL:en mot din egen server. För demonstration används https://webhook.site/ som genererar en publik webhook-URL: Kopiera URL:en, t.ex. https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab. Skicka sedan anrop med callback_url satt till denna URL:
Svar:
Efter en stund kan du se resultatet på webhook-sidan:
Resultatet innehåller task_id och data med samma bildgenereringsresultat som synkront anrop, vilket möjliggör koppling via uppgifts-ID.

Felhantering

Vid fel returnerar API lämplig felkod och meddelande, t.ex.:
  • 400 token_mismatched: Felaktig förfrågan, saknade eller ogiltiga parametrar.
  • 400 api_not_implemented: Felaktig förfrågan, saknade eller ogiltiga parametrar.
  • 401 invalid_token: Obehörig, ogiltig eller saknad token.
  • 429 too_many_requests: För många förfrågningar, gränsen överskriden.
  • 500 api_error: Intern serverfel.

Exempel på felrespons

Slutsats

Med detta dokument har du lärt dig hur du enkelt använder OpenAI Images Generations API för att använda officiella OpenAI DALL-E bildgenereringsfunktioner. Vi hoppas detta hjälper dig att integrera och använda API:et bättre. Vid frågor, kontakta gärna vårt tekniska supportteam.