Skip to main content
La API de Generación de Imágenes de OpenAI actualmente soporta varios modelos de generación de imágenes, incluyendo el clásico dall-e-3, el modelo con mayor capacidad de renderizado de texto gpt-image-1, la última generación gpt-image-2, así como la serie de modelos nano-banana / nano-banana-2 / nano-banana-pro accesibles a través de la misma interfaz. Todos ellos pueden generar imágenes de alta calidad basadas en descripciones de texto. Este documento describe principalmente el proceso de uso de la API de Generación de Imágenes de OpenAI, con la cual podemos utilizar fácilmente las funcionalidades de generación de imágenes de la serie OpenAI.

Proceso de Solicitud

Para usar la API de Generación de Imágenes de OpenAI, primero puede ir a la página OpenAI Images Generations API y hacer clic en el botón “Acquire” para obtener las credenciales necesarias para realizar solicitudes: Si aún no ha iniciado sesión o registrado, será redirigido automáticamente a la página de inicio de sesión para registrarse e iniciar sesión; después de esto, volverá automáticamente a la página actual. Al solicitar por primera vez, se otorgará un crédito gratuito para usar la API sin costo.

Modelo GPT-Image-2

gpt-image-2 es el modelo de generación de imágenes de nueva generación lanzado por OpenAI, que presenta mejoras claras en comparación con dall-e-3 y gpt-image-1 en los siguientes aspectos:
  • Mejor capacidad para seguir instrucciones: Puede comprender con precisión instrucciones estructuradas complejas como composición, conteo y relaciones de posición.
  • Renderizado de texto más claro: En escenarios como carteles, menús, infografías y logotipos, el texto en inglés y los números casi no presentan errores.
  • Mayor riqueza en la expresión de estilos: Soporta de forma nativa múltiples estilos como retratos cinematográficos, carteles vintage, ilustraciones infantiles, fotografía de productos e infografías.
  • Soporte nativo para múltiples proporciones + alta resolución: Cubre 5 proporciones (1:1, 4:3, 3:4, 16:9, 9:16) con 3 niveles de resolución (1K / 2K / 4K).
La forma de llamar es idéntica a otros modelos, solo necesita establecer el campo model en gpt-image-2. La URL devuelta en el resultado es un enlace permanente alojado en platform.cdn.acedata.cloud, que puede abrirse directamente en el navegador o incrustarse en páginas web.

Valores soportados para size

gpt-image-2 solo verifica el formato de size; siempre que no sea auto o cadena vacía, debe coincidir con WIDTHxHEIGHT (por ejemplo, 1024x1024, 2048x1152, 800x600); cualquier otro formato devolverá un error 400. Todas las dimensiones (1K / 2K / 4K / personalizadas) se cobran por imagen generada, sin recargo por tamaño. Restricciones estrictas de la plataforma para tamaños personalizados: ancho y alto deben ser múltiplos de 16, el lado largo ≤ 3840, y el total de píxeles ≤ 8,294,400. Si excede, será rechazado con un código 4xx.
También puede enviar size: "auto" o omitir el campo size, en cuyo caso el modelo seleccionará el tamaño predeterminado automáticamente. En la resolución 1K, la salida no garantiza una alineación exacta de píxeles — si envía 1024x1024, puede recibir 1254x1254, manteniendo la proporción. Si vuelve a enviar esta dimensión como size, el cobro es el mismo. La llamada en 4K suele tardar entre 4 y 8 minutos; se recomienda usar el mecanismo de callback_url para llamadas asíncronas.
Sobre el parámetro n Actualmente gpt-image-2 no soporta n > 1: este parámetro será ignorado silenciosamente; ya sea que envíe n=1 o n=10, solo devolverá 1 imagen por solicitud y cobrará por 1 imagen. Si necesita varias imágenes candidatas, debe realizar múltiples solicitudes concurrentes (se recomienda usar diferentes prompt o seed para evitar imágenes muy similares). Esta restricción también aplica para gpt-image-1 / gpt-image-1.5 y la serie nano-banana. dall-e-2 es el único modelo que soporta n > 1 de forma nativa; dall-e-3 solo soporta n = 1.
A continuación, algunos ejemplos reales para apreciar intuitivamente las capacidades de gpt-image-2.

Escenario 1: Retrato cinematográfico

En el prompt puede usar términos cinematográficos (película de 35mm, poca profundidad de campo, luces de neón, etc.) para controlar con precisión la atmósfera y textura. Código de ejemplo en Python:
Respuesta:
Imagen generada:

Escenario 2: Cartel de viaje vintage (con renderizado de texto)

gpt-image-2 tiene un rendimiento estable en tipografía y maquetación, ideal para generar carteles, menús, tarjetas con texto.
Imagen generada:

El modelo reproduce fielmente el estilo Art Deco, con los textos AMALFI y ITALIA 1958 claros y correctos.

Escenario 3: Composición compleja y conteo

Este prompt prueba la capacidad del modelo para seguir instrucciones estructuradas de cantidad y posición.
Imagen generada:

Se observa que la cantidad de libros (1 / 3 / 7) coincide perfectamente con el prompt, algo difícil de lograr de forma estable en la era de dall-e-3.

Escenario 4: Estilo ilustración (horizontal)

Especificando medios artísticos y palabras clave de emoción, se puede guiar al modelo para producir ilustraciones estilizadas.
Ilustración horizontal generada:

Asíncrono y Callback

La llamada a gpt-image-2 suele tardar entre 60 y 90 segundos. Si no desea mantener la conexión abierta, puede usar el mecanismo de callback asíncrono callback_url descrito más adelante; el proceso es idéntico al de otros modelos.

Serie de Modelos Nano Banana

La serie nano-banana es un modelo de generación de imágenes basado en Gemini, accesible a través de la misma interfaz /openai/images/generations sin cambiar el endpoint, solo cambiando el campo model a cualquiera de los siguientes:
Importante: rango de parámetros soportados Nano Banana se integra mediante una capa adaptadora al protocolo OpenAI y, comparado con gpt-image-*, solo soporta los parámetros: model, prompt, size.
  • size se mapea internamente a aspect_ratio según la tabla siguiente; tamaños no listados se degradan a 1:1:
    • 1024x1024 / 512x512 / 256x2561:1
    • 1792x102416:9
    • 1024x17929:16
  • No soporta n, quality, style, response_format, background, output_format; si se envían, se ignoran.
  • La estructura de respuesta sigue el formato OpenAI (data[].url), pero created es siempre 0, no devuelve b64_json, y revised_prompt siempre es igual al prompt original.

Llamada básica

Respuesta:
La imagen generada puede accederse directamente mediante el campo url:

Actualización al modelo insignia nano-banana-pro

Solo cambie model a nano-banana-pro, los demás parámetros permanecen iguales:
Ejemplo de respuesta:

Callback asíncrono

El mecanismo de callback callback_url también es válido para nano-banana, el proceso es idéntico al de otros modelos, ver la sección Callback asíncrono a continuación.

Uso básico

Luego puede rellenar los campos correspondientes en la interfaz, como se muestra:

Al usar la API por primera vez, debe completar al menos tres campos: authorization, que puede seleccionar directamente del menú desplegable; model, que es la categoría del modelo OpenAI DALL-E que desea usar (aquí principalmente un modelo, consulte los detalles de los modelos disponibles); y finalmente prompt, que es la descripción para generar la imagen. También puede notar que a la derecha se genera el código de llamada correspondiente, que puede copiar y ejecutar directamente o hacer clic en el botón “Try” para probar.

Ejemplo de código Python:
Respuesta:
Los campos devueltos incluyen:
  • created: ID único para esta tarea de generación de imagen.
  • data: contiene la información del resultado de la imagen generada.
Dentro de data, el campo url es el enlace a la imagen generada, como se muestra:

Parámetro de calidad de imagen quality

A continuación se explica cómo configurar parámetros detallados para la generación de imágenes. El parámetro de calidad quality tiene dos opciones: standard para imágenes estándar, y hd para imágenes con detalles más finos y mayor coherencia. Ejemplo configurando quality a standard:

El código generado a la derecha puede copiarse o probarse con el botón “Try”.

Ejemplo en Python:
Respuesta:
La imagen generada con quality en standard es:

Con la misma operación, cambiando a hd se obtiene una imagen con detalles más finos y mayor coherencia:

Parámetro de tamaño de imagen size

También puede configurar el tamaño de la imagen generada. Ejemplo configurando tamaño a 1024x1024:

El código generado a la derecha puede copiarse o probarse con el botón “Try”.

Ejemplo en Python:
Respuesta:
Imagen generada con tamaño 1024x1024:

Con la misma operación, configurando tamaño a 1792x1024 se obtiene: Se observa claramente la diferencia de tamaño. Puede configurar más tamaños, consulte la documentación oficial para más detalles.

Parámetro de estilo de imagen style

El parámetro style tiene dos opciones: vivid para imágenes más vívidas, y natural para imágenes más naturales. Ejemplo configurando style a vivid:

El código generado a la derecha puede copiarse o probarse con el botón “Try”.

Ejemplo en Python:
Respuesta:
Imagen generada con style en vivid:

Con la misma operación, configurando style a natural se obtiene:

Se observa que vivid genera imágenes más vivas que natural.

Parámetro de formato de enlace de imagen response_format

El parámetro response_format tiene dos opciones: b64_json para codificar la imagen en Base64, y url para obtener un enlace directo a la imagen. Ejemplo configurando response_format a url:

El código generado a la derecha puede copiarse o probarse con el botón “Try”.

Ejemplo en Python:
Respuesta:
El enlace de la imagen generada con response_format en url es Imagen URL, accesible directamente, con contenido como se muestra:

Con la misma operación, configurando response_format a b64_json se obtiene la imagen codificada en Base64, ejemplo:

Callback asíncrono

Dado que la generación de imágenes con la API de OpenAI puede tardar un tiempo considerable, mantener la conexión HTTP abierta consume recursos del sistema. Por ello, esta API también soporta callbacks asíncronos. El flujo es: el cliente envía la solicitud incluyendo un campo adicional callback_url. La API responde inmediatamente con un resultado que incluye un task_id que identifica la tarea. Cuando la tarea termina, el resultado con la imagen generada se envía mediante un POST JSON al callback_url especificado, incluyendo también el task_id para relacionar la respuesta con la solicitud. Ejemplo práctico: El webhook callback es un servicio que recibe solicitudes HTTP; el desarrollador debe reemplazarlo con la URL de su propio servidor HTTP. Para demostración, se usa el sitio público https://webhook.site/, que genera una URL de webhook, como se muestra: Copie esta URL, por ejemplo https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab, y úsela como webhook. Luego configure el campo callback_url con esta URL y envíe la solicitud:
La respuesta inmediata será:
Después de un momento, en la URL del webhook podrá ver el resultado de la generación:
Se observa el campo task_id y el campo data con el mismo resultado que en la llamada síncrona, permitiendo relacionar la respuesta con la tarea.

Manejo de errores

Al llamar a la API, si ocurre un error, la API devolverá un código y mensaje de error correspondiente. Por ejemplo:
  • 400 token_mismatched: Solicitud incorrecta, posiblemente por parámetros faltantes o inválidos.
  • 400 api_not_implemented: Solicitud incorrecta, posiblemente por parámetros faltantes o inválidos.
  • 401 invalid_token: No autorizado, token de autorización inválido o faltante.
  • 429 too_many_requests: Demasiadas solicitudes, ha excedido el límite de tasa.
  • 500 api_error: Error interno del servidor.

Ejemplo de respuesta de error

Conclusión

Con este documento, ha aprendido cómo usar la API de Generación de Imágenes de OpenAI para utilizar fácilmente la función oficial de generación de imágenes DALL-E de OpenAI. Esperamos que esta documentación le ayude a integrar y usar mejor esta API. Si tiene alguna pregunta, no dude en contactar a nuestro equipo de soporte técnico.