For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Generación de imágenes

Aprende a generar o editar imágenes.

Descripción general

La API te permite generar y editar imágenes a partir de prompts de texto con gpt-image-2.5-sunburst y gpt-image-2.5-flare. Elige Sunburst para flujos de trabajo donde la precisión de la edición sea lo más importante, y Flare para generar imágenes cotidianas de alta calidad con rapidez. Puedes acceder a las capacidades de generación de imágenes a través de dos API:

API de imágenes

La API de imágenes ofrece dos puntos de acceso, cada uno con capacidades distintas:

API Responses

La API Responses te permite generar imágenes como parte de conversaciones o flujos de varios pasos. Ofrece la generación de imágenes como una herramienta integrada y acepta imágenes de entrada y de salida dentro del contexto.

En comparación con la API de imágenes, agrega:

  • Edición en varios turnos: realiza ediciones de alta fidelidad en imágenes de forma iterativa mediante prompts
  • Entradas flexibles: acepta IDs de objetos File de imágenes como imágenes de entrada, además de bytes

Para conocer los modelos principales que pueden llamar a la herramienta de generación de imágenes, consulta los modelos compatibles.

Elegir la API adecuada

  • Si solo necesitas generar o editar una imagen a partir de un prompt, la API de imágenes es tu mejor opción.
  • Si quieres crear experiencias con GPT Image que permitan generar y editar imágenes mediante conversaciones, elige la API Responses.

Con la API de imágenes, establece model directamente en gpt-image-2.5-sunburst o gpt-image-2.5-flare. Con la API Responses, selecciona un modelo principal compatible en el nivel superior y especifica gpt-image-2.5-sunburst o gpt-image-2.5-flare en el campo model de la herramienta de generación de imágenes.

Ambas API te permiten personalizar la salida ajustando la calidad, el tamaño, el formato y la compresión.

Para garantizar el uso responsable de estos modelos, es posible que debas completar la verificación de la organización para la API desde tu consola de desarrollador antes de usar los modelos GPT Image.

Una taza de café beige sobre una mesa de madera

Generar imágenes

Puedes usar el punto de acceso de generación de imágenes para crear imágenes a partir de prompts de texto, o la herramienta de generación de imágenes de la API Responses para generar imágenes como parte de una conversación.

Para obtener más información sobre cómo personalizar la salida (tamaño, calidad, formato y compresión), consulta la sección Personalizar la salida de imágenes más abajo.

Puedes configurar el parámetro n para generar varias imágenes a la vez en una sola solicitud (de forma predeterminada, la API devuelve una sola imagen).

Generar una imagen
from openai import OpenAI
import base64

client = OpenAI()

prompt = """
A children's book drawing of a veterinarian using a stethoscope to
listen to the heartbeat of a baby otter.
"""

result = client.images.generate(model="gpt-image-2.5-sunburst", prompt=prompt)

image_base64 = result.data[0].b64_json
image_bytes = base64.b64decode(image_base64)

# Save the image to a file
with open("otter.png", "wb") as f:
    f.write(image_bytes)

Generación de imágenes en varios turnos

Con la API Responses, puedes crear conversaciones de varios turnos que incluyan generación de imágenes, ya sea proporcionando las salidas de las llamadas de generación de imágenes dentro del contexto (también puedes usar solo el ID de la imagen) o usando el parámetro previous_response_id. Esto te permite trabajar de forma iterativa en las imágenes a lo largo de varios turnos: refinar los prompts, aplicar nuevas instrucciones y modificar el resultado visual a medida que avanza la conversación.

Con la herramienta de generación de imágenes de la API Responses, los modelos compatibles de la herramienta pueden elegir entre generar una imagen nueva o editar una que ya esté en la conversación. El parámetro opcional action controla este comportamiento: conserva action: "auto" para que el modelo decida, establece action: "generate" para crear siempre una imagen nueva o establece action: "edit" para forzar la edición cuando haya una imagen en el contexto.

Forzar la creación de imágenes con action
from openai import OpenAI
import base64

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    input="Generate an image of gray tabby cat hugging an otter with an orange scarf",
    tools=[
        {"type": "image_generation", "model": "gpt-image-2.5-sunburst", "action": "generate"}
    ],
)

# Save the image to a file
image_data = [
    output.result
    for output in response.output
    if output.type == "image_generation_call"
]

if image_data:
    image_base64 = image_data[0]
    with open("otter.png", "wb") as f:
        f.write(base64.b64decode(image_base64))

Si fuerzas edit sin proporcionar una imagen en el contexto, la llamada devolverá un error. Deja action en auto para que el modelo decida cuándo generar o editar.

Generación de imágenes en varios turnos
from openai import OpenAI
import base64

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    input="Generate an image of gray tabby cat hugging an otter with an orange scarf",
    tools=[{"type": "image_generation", "model": "gpt-image-2.5-sunburst"}],
)

image_data = [
    output.result
    for output in response.output
    if output.type == "image_generation_call"
]

if image_data:
    image_base64 = image_data[0]

    with open("cat_and_otter.png", "wb") as f:
        f.write(base64.b64decode(image_base64))


# Follow up

response_fwup = client.responses.create(
    model="gpt-6-astra",
    previous_response_id=response.id,
    input="Now make it look realistic",
    tools=[{"type": "image_generation", "model": "gpt-image-2.5-sunburst"}],
)

image_data_fwup = [
    output.result
    for output in response_fwup.output
    if output.type == "image_generation_call"
]

if image_data_fwup:
    image_base64 = image_data_fwup[0]
    with open("cat_and_otter_realistic.png", "wb") as f:
        f.write(base64.b64decode(image_base64))

Resultado

“Genera una imagen de un gato atigrado gris abrazando a una nutria con una bufanda naranja”

Un gato y una nutria

“Ahora dale un aspecto realista”

Un gato y una nutria

Transmisión continua

La API Responses y la API de imágenes admiten la generación de imágenes con transmisión continua. Puedes transmitir imágenes parciales a medida que las API las generan para ofrecer una experiencia más interactiva.

Puedes ajustar el parámetro partial_images para recibir de 0 a 3 imágenes parciales.

  • Si estableces partial_images en 0, solo recibirás la imagen final.
  • Para valores mayores que cero, es posible que no recibas todas las imágenes parciales que solicitaste si la imagen completa se genera más rápido.
Transmitir una imagen de forma continua
from openai import OpenAI
import base64

client = OpenAI()


def save_base64_image(filename, image_base64):
    image_bytes = base64.b64decode(image_base64)
    with open(filename, "wb") as f:
        f.write(image_bytes)


stream = client.responses.create(
    model="gpt-6-astra",
    input="Draw a gorgeous image of a river made of white owl feathers, snaking its way through a serene winter landscape",
    stream=True,
    tools=[
        {"type": "image_generation", "model": "gpt-image-2.5-sunburst", "partial_images": 2}
    ],
)

for event in stream:
    if event.type == "response.image_generation_call.partial_image":
        idx = event.partial_image_index
        save_base64_image(f"river-partial-{idx}.png", event.partial_image_b64)
    elif event.type == "response.completed":
        image_data = [
            output.result
            for output in event.response.output
            if output.type == "image_generation_call"
        ]

        if image_data:
            save_base64_image("river-final.png", image_data[0])

Resultado

Parcial 1Parcial 2Imagen final
Primera imagen parcialSegunda imagen parcialImagen final

Prompt: dibuja una hermosa imagen de un río hecho de plumas blancas de búho que serpentea por un apacible paisaje invernal

Prompt revisado

Al usar la herramienta de generación de imágenes en la API Responses, el modelo principal (por ejemplo, gpt-5.5) revisará automáticamente tu prompt para mejorar el rendimiento.

Puedes acceder al prompt revisado en el campo revised_prompt de la llamada de generación de imágenes:

Respuesta con el prompt revisado
{
  "id": "ig_123",
  "type": "image_generation_call",
  "status": "completed",
  "revised_prompt": "A gray tabby cat hugging an otter. The otter is wearing an orange scarf. Both animals are cute and friendly, depicted in a warm, heartwarming style.",
  "result": "..."
}

Editar imágenes

El punto de acceso de edición de imágenes te permite:

  • Editar imágenes existentes
  • Generar imágenes nuevas usando otras imágenes como referencia
  • Editar partes de una imagen cargando una imagen y una máscara que identifique las áreas que se deben reemplazar

Crear una imagen nueva usando imágenes de referencia

Puedes usar una o más imágenes como referencia para generar una imagen nueva.

En este ejemplo, usaremos 4 imágenes de entrada para generar una imagen nueva de una canasta de regalo que contenga los artículos de las imágenes de referencia.

Loción corporalJabónKit de inciensoBomba de baño
Set de baño para regalo

Con la API Responses, puedes proporcionar imágenes de entrada de 3 formas diferentes:

  • Proporcionando una URL completa
  • Proporcionando una imagen como una URL de datos codificada en Base64
  • Proporcionando un ID de archivo (creado con la Files API)

Crear un archivo

Crear un archivo
from openai import OpenAI

client = OpenAI()


def create_file(file_path):
    with open(file_path, "rb") as file_content:
        result = client.files.create(
            file=file_content,
            purpose="vision",
        )
        return result.id

Crear una imagen codificada en base64

Crear una imagen codificada en base64
import base64


def encode_image(file_path):
    with open(file_path, "rb") as f:
        base64_image = base64.b64encode(f.read()).decode("utf-8")
    return base64_image
Editar una imagen
from openai import OpenAI
import base64

client = OpenAI()


def encode_image(file_path):
    with open(file_path, "rb") as image_file:
        return base64.b64encode(image_file.read()).decode("utf-8")


def create_file(file_path):
    with open(file_path, "rb") as file_content:
        result = client.files.create(file=file_content, purpose="vision")
    return result.id


prompt = """Generate a photorealistic image of a gift basket on a white background
labeled 'Relax & Unwind' with a ribbon and handwriting-like font,
containing all the items in the reference pictures."""

base64_image1 = encode_image("body-lotion.png")
base64_image2 = encode_image("soap.png")
file_id1 = create_file("bath-bomb.png")
file_id2 = create_file("incense-kit.png")

response = client.responses.create(
    model="gpt-6-astra",
    input=[
        {
            "role": "user",
            "content": [
                {"type": "input_text", "text": prompt},
                {
                    "type": "input_image",
                    "image_url": f"data:image/png;base64,{base64_image1}",
                },
                {
                    "type": "input_image",
                    "image_url": f"data:image/png;base64,{base64_image2}",
                },
                {
                    "type": "input_image",
                    "file_id": file_id1,
                },
                {
                    "type": "input_image",
                    "file_id": file_id2,
                },
            ],
        }
    ],
    tools=[{"type": "image_generation", "model": "gpt-image-2.5-sunburst"}],
)

image_generation_calls = [
    output for output in response.output if output.type == "image_generation_call"
]

image_data = [output.result for output in image_generation_calls]

if image_data:
    image_base64 = image_data[0]
    with open("gift-basket.png", "wb") as f:
        f.write(base64.b64decode(image_base64))
else:
    print(response.output_text)

Editar una imagen con una máscara

Puedes proporcionar una máscara para indicar qué parte de la imagen se debe editar.

Cuando usas una máscara con GPT Image, se envían instrucciones adicionales al modelo para orientar el proceso de edición según la máscara.

El uso de máscaras con GPT Image se basa por completo en prompts. El modelo usa la máscara como guía, pero puede que no siga su forma exacta con total precisión.

Si proporcionas varias imágenes de entrada, la máscara se aplicará a la primera imagen.

Editar una imagen con una máscara
from openai import OpenAI
import base64

client = OpenAI()


def create_file(file_path):
    with open(file_path, "rb") as file_content:
        result = client.files.create(file=file_content, purpose="vision")
    return result.id


fileId = create_file("sunlit_lounge.png")
maskId = create_file("mask.png")

response = client.responses.create(
    model="gpt-6-astra",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "generate an image of the same sunlit indoor lounge area with a pool but the pool should contain a flamingo",
                },
                {
                    "type": "input_image",
                    "file_id": fileId,
                },
            ],
        },
    ],
    tools=[
        {
            "type": "image_generation",
            "model": "gpt-image-2.5-sunburst",
            "quality": "high",
            "input_image_mask": {
                "file_id": maskId,
            },
        },
    ],
)

image_data = [
    output.result
    for output in response.output
    if output.type == "image_generation_call"
]

if image_data:
    image_base64 = image_data[0]
    with open("lounge.png", "wb") as f:
        f.write(base64.b64decode(image_base64))
ImagenMáscaraResultado
Una habitación rosa con una piscinaUna máscara en una parte de la piscinaLa piscina original con un flamenco inflable en lugar de la máscara

Prompt: un área de descanso interior iluminada por el sol, con una piscina que contiene un flamenco

Requisitos de la máscara

La imagen que se va a editar y la máscara deben tener el mismo formato y tamaño (menos de 50 MB).

La imagen de la máscara también debe contener un canal alfa. Si usas una herramienta de edición de imágenes para crear la máscara, asegúrate de guardarla con un canal alfa.

Puedes modificar una imagen en blanco y negro mediante código para agregarle un canal alfa.

Agregar un canal alfa a una máscara en blanco y negro
from PIL import Image
from io import BytesIO

# 1. Load your black & white mask as a grayscale image
mask = Image.open("mask.png").convert("L")

# 2. Convert it to RGBA so it has space for an alpha channel
mask_rgba = mask.convert("RGBA")

# 3. Then use the mask itself to fill that alpha channel
mask_rgba.putalpha(mask)

# 4. Convert the mask into bytes
buf = BytesIO()
mask_rgba.save(buf, format="PNG")
mask_bytes = buf.getvalue()

# 5. Save the resulting file
img_path_mask_alpha = "mask_alpha.png"
with open(img_path_mask_alpha, "wb") as f:
    f.write(mask_bytes)

Personalizar la imagen de salida

Puedes configurar las siguientes opciones de salida:

  • Tamaño: dimensiones de la imagen (por ejemplo, 1024x1024, 1024x1536)
  • Calidad: calidad de renderizado (por ejemplo, low, medium, high)
  • Formato: formato del archivo de salida
  • Compresión: nivel de compresión (0-100 %) para los formatos JPEG y WebP
  • Fondo: transparente, opaco o automático

size, quality y background admiten la opción auto, con la que el modelo selecciona automáticamente la mejor opción según el prompt.

Opciones de tamaño y calidad

gpt-image-2.5-sunburst y gpt-image-2.5-flare incorporan las opciones de calidad xhigh y max. Ambos usan auto de forma predeterminada. Los modelos anteriores de GPT Image admiten opciones de calidad hasta high.

ConfiguraciónOpciones
Tamaños recomendados1024x1024 (cuadrado), 1536x1024 (horizontal), 1024x1536 (vertical)
Calidadlow, medium, high, xhigh, max, auto

Ambos modelos también admiten dimensiones personalizadas como cadenas con el formato WIDTHxHEIGHT, por ejemplo, 1536x864. El ancho y la altura deben ser múltiplos de 16, la relación de aspecto debe estar entre 1:3 y 3:1, y ninguno de los lados puede superar los 3840 píxeles. El total de píxeles debe estar entre 655 360 y 8 294 400 (4K). Las resoluciones superiores a 2560x1440 son experimentales.

Para obtener fondos transparentes con cualquiera de los dos modelos, configura background: "transparent" y usa output_format: "png" o "webp".

Usa quality: "low" para crear borradores rápidos. Para los recursos finales, compara las opciones de mayor calidad para encontrar el equilibrio adecuado entre detalle, latencia y costo.

Formato de salida

La API de imágenes devuelve datos de imagen codificados en base64. El formato predeterminado es png, pero también puedes solicitar jpeg o webp.

Si usas jpeg o webp, también puedes especificar el parámetro output_compression para controlar el nivel de compresión (0-100 %). Por ejemplo, output_compression=50 comprimirá la imagen un 50 %.

Usar jpeg es más rápido que usar png, por lo que deberías priorizar este formato si la latencia es un factor importante.

Limitaciones

Los modelos GPT Image son modelos de generación de imágenes potentes y versátiles, pero aún tienen algunas limitaciones que debes tener en cuenta:

  • Latencia: procesar prompts complejos puede tardar hasta 2 minutos.
  • Renderizado de texto: aunque ha mejorado considerablemente, el modelo aún puede tener dificultades para colocar el texto con precisión y lograr que sea claro.
  • Consistencia: aunque puede producir imágenes consistentes, el modelo puede tener dificultades ocasionales para mantener la consistencia visual de personajes recurrentes o elementos de marca a lo largo de varias generaciones.
  • Control de la composición: aunque ha mejorado su capacidad para seguir instrucciones, el modelo puede tener dificultades para colocar elementos con precisión en composiciones estructuradas o que requieren una distribución específica.

Moderación de contenido

Todos los prompts y las imágenes generadas se filtran de acuerdo con nuestra política de contenido.

Al generar imágenes con los modelos GPT Image, puedes controlar qué tan estricta es la moderación con el parámetro moderation. Este parámetro admite dos valores:

  • auto (predeterminado): filtrado estándar que busca limitar la creación de ciertas categorías de contenido que podría ser inapropiado para algunas edades.
  • low: filtrado menos restrictivo.

Manejo de solicitudes bloqueadas y otros errores

Maneja las fallas de generación de imágenes del mismo modo que los demás errores de la API: verifica el estado HTTP o el tipo de excepción del SDK, registra el ID de la solicitud y consulta la guía de códigos de error para las fallas de autenticación, cuota, límite de solicitudes y servidor. Reintenta las solicitudes ante fallas transitorias por límites de solicitudes o del servidor, con intervalos de espera crecientes. No reintentes automáticamente ante errores de cuota ni errores de usuario en la generación de imágenes que requieran modificar la solicitud.

Algunas fallas de generación de imágenes pueden ser corregidas por el usuario y pueden devolver error.type = "image_generation_user_error". No reintentes automáticamente ante estos errores sin modificar el prompt o las imágenes de entrada. Para manejarlos mediante código, usa error.code como criterio estable de diferenciación.

Cuando error.code = "moderation_blocked", el error también puede incluir un objeto opcional error.moderation_details:

{
  "error": {
    "type": "image_generation_user_error",
    "code": "moderation_blocked",
    "moderation_details": {
      "moderation_stage": "input",
      "categories": ["harassment"]
    }
  }
}

El objeto moderation_details proporciona contexto general para la depuración sin exponer etiquetas ni puntuaciones internas del clasificador.

moderation_stage puede ser:

  • input: el bloqueo se originó en el prompt o en las entradas de la solicitud.
  • output: el bloqueo se originó en una imagen generada o en una etapa posterior de moderación de la salida.
  • unknown: un valor de respaldo poco frecuente cuando es difícil determinar el origen.

categories contiene etiquetas públicas generales. Por ejemplo, podrías ver valores como harassment, self-harm, sexual o violence.

En la mayoría de las aplicaciones, mantén genérico el mensaje principal para el usuario final. Usa moderation_details para los registros de desarrolladores, los flujos de trabajo de soporte, los análisis y las sugerencias básicas para corregir el problema.

Manejar errores de generación de imágenes por bloqueos de moderación
import OpenAI from "openai";

const openai = new OpenAI();

try {
  // The same error handling pattern applies to image generation requests,
  // image edits, and Responses API tool calls that generate images.
  await openai.images.generate({
    model: "gpt-image-2.5-sunburst",
    prompt: "Create a poster humiliating my coworker with insulting captions",
  });
} catch (error) {
  if (error?.code !== "moderation_blocked") {
    throw error;
  }

  const moderationDetails = error.error?.moderation_details;
  const categories = moderationDetails?.categories ?? [];
  const stage = moderationDetails?.moderation_stage;

  let hint =
    "This request could not be completed because it did not meet safety requirements.";

  if (categories.includes("harassment")) {
    hint =
      "Try removing abusive or targeting language and focus on neutral visual details instead.";
  } else if (stage === "input") {
    hint =
      "Try revising the prompt or input images and submit the request again.";
  } else if (stage === "output") {
    hint =
      "The generated result was blocked by a safety check. Try changing the prompt and generating again.";
  }

  console.error("Image generation blocked", {
    request_id: error?.requestID,
    code: error?.code,
    moderation_details: moderationDetails,
  });

  console.log(hint);
}

Modelos compatibles

Al usar la generación de imágenes en la API Responses, gpt-5 y los modelos más recientes deberían admitir la herramienta de generación de imágenes. Consulta la página de detalles de tu modelo para confirmar si el modelo que deseas puede usar la herramienta de generación de imágenes.

Costo y latencia

Costos de GPT Image 2.5

Las solicitudes a la API Responses incluyen el consumo de tokens del modelo principal, además de los costos de generación de imágenes.

Ambos modelos GPT Image 2.5 tienen las mismas tarifas por token: $8 por millón de tokens de imagen de entrada, $2 por millón de tokens de imagen de entrada en caché, $30 por millón de tokens de imagen de salida, $5 por millón de tokens de texto de entrada y $1,25 por millón de tokens de texto de entrada en caché. Consulta los precios.

Usa usage de la respuesta para medir el consumo de tokens según tus prompts, tamaños y configuraciones de calidad. Tener las mismas tarifas por token no implica el mismo costo por imagen: el consumo de tokens puede variar según el modelo y la configuración de calidad. Para ver ejemplos de precios de modelos anteriores, consulta Modelos GPT Image anteriores.

Tokens de salida de GPT Image 2.5 y GPT Image 2

Selecciona un modelo, una calidad y un tamaño para estimar los tokens de salida y el costo de la imagen de salida. Para gpt-image-2.5-sunburst y gpt-image-2.5-flare, las opciones de calidad son low, medium, high, xhigh y max. Para gpt-image-2, las opciones son low, medium y high. Los modelos pueden usar distintas cantidades de tokens con la misma configuración de calidad y tienen el mismo precio por token de imagen de salida. Usa valores explícitos de calidad y tamaño para esta estimación; auto depende de la imagen generada.

Modelo
Calidad
Tokens de salida
196
Costo estimado de la imagen de salida
$0.00588

Por imagen, a una tarifa de 30 USD por millón de tokens de imagen de salida. Excluye los tokens de texto e imagen de entrada y las imágenes parciales de la transmisión continua.

Costo de las imágenes parciales

Si quieres recibir imágenes mediante transmisión continua con el parámetro partial_images, cada imagen parcial consumirá 100 tokens de imagen de salida adicionales.

Modelos GPT Image anteriores

Los detalles que aparecen a continuación se aplican a los modelos anteriores, no a Sunburst ni a Flare. Para nuevas integraciones, usa uno de los modelos GPT Image 2.5 descritos arriba.

Configuración y fidelidad de entrada de GPT Image 2

gpt-image-2 acepta cualquier resolución en el parámetro size que cumpla con las restricciones que aparecen a continuación. Las imágenes cuadradas suelen ser las más rápidas de generar.

Tamaños populares
  • 1024x1024 (cuadrada)

  • 1536x1024 (horizontal)

  • 1024x1536 (vertical)

  • 2048x2048 (cuadrada 2K)

  • 2048x1152 (horizontal 2K)

  • 3840x2160 (horizontal 4K)

  • 2160x3840 (vertical 4K)

  • auto (predeterminado)

Restricciones de tamaño
  • La longitud máxima de un lado debe ser menor o igual a 3840px

  • Ambos lados deben ser múltiplos de 16px

  • La relación entre el lado largo y el lado corto no debe superar 3:1

  • La cantidad total de píxeles debe ser como mínimo 655,360 y como máximo 8,294,400

Opciones de calidad
  • low
  • medium
  • high
  • auto (predeterminado)

Fidelidad de las imágenes de entrada

El parámetro input_fidelity controla en qué medida un modelo conserva los detalles de las imágenes de entrada durante las ediciones y los flujos de trabajo con imágenes de referencia. Para gpt-image-2, omite este parámetro; la API no permite cambiarlo porque el modelo procesa automáticamente todas las imágenes de entrada con alta fidelidad.

Como gpt-image-2 siempre procesa las imágenes de entrada con alta fidelidad, la cantidad de tokens de imagen de entrada puede ser mayor en las solicitudes de edición que incluyen imágenes de referencia. Para entender cómo afecta esto al costo, consulta la sección costos de visión.

Ejemplos de precios de modelos anteriores

Modelos anteriores a gpt-image-2

Los modelos GPT Image anteriores a gpt-image-2 generan imágenes produciendo primero tokens de imagen especializados. Tanto la latencia como el costo final son proporcionales a la cantidad de tokens necesarios para renderizar una imagen: los tamaños de imagen más grandes y las configuraciones de mayor calidad generan más tokens.

La cantidad de tokens generados depende de las dimensiones y la calidad de la imagen:

CalidadCuadrada (1024×1024)Vertical (1024×1536)Horizontal (1536×1024)
Baja272 tokens408 tokens400 tokens
Media1056 tokens1584 tokens1568 tokens
Alta4160 tokens6240 tokens6208 tokens

Ten en cuenta que también debes considerar los tokens de entrada: tokens de texto para el prompt y tokens de imagen para las imágenes de entrada si editas imágenes. Como gpt-image-2 siempre procesa las imágenes de entrada con alta fidelidad, las solicitudes de edición que incluyen imágenes de referencia pueden usar más tokens de entrada.

Consulta la página de precios para conocer los precios actuales de los tokens de texto e imagen, y usa la sección Cálculo de costos que aparece a continuación para estimar los costos de las solicitudes.

El costo final es la suma de:

  • tokens de texto de entrada
  • tokens de imagen de entrada si usas el punto de acceso de ediciones
  • tokens de imagen de salida

Cálculo de costos

Usa la calculadora de precios que aparece a continuación para estimar los costos de las solicitudes a los modelos GPT Image. gpt-image-2 admite miles de resoluciones válidas; la siguiente tabla muestra los mismos tamaños usados para los modelos GPT Image anteriores para facilitar la comparación. Para GPT Image 1.5, GPT Image 1 y GPT Image 1 Mini, también se incluye a continuación la tabla anterior de precios de salida por imagen. De todos modos, debes considerar los tokens de texto e imagen de entrada al estimar el costo total de una solicitud.

Una resolución más grande y no cuadrada a veces puede producir menos tokens de salida que una resolución más pequeña o cuadrada con la misma configuración de calidad.

Modelo

Calidad

1024 x 1024 1024 x 1536 1536 x 1024

GPT Image 2


Más tamaños disponibles
Baja $0,006 $0,005 $0,005
Media $0,053 $0,041 $0,041
Alta $0,211 $0,165 $0,165

GPT Image 1.5

Baja $0,009 $0,013 $0,013
Media $0,034 $0,05 $0,05
Alta $0,133 $0,2 $0,2

GPT Image 1

Baja $0,011 $0,016 $0,016
Media $0,042 $0,063 $0,063
Alta $0,167 $0,25 $0,25

GPT Image 1 Mini

Baja $0,005 $0,006 $0,006
Media $0,011 $0,015 $0,015
Alta $0,036 $0,052 $0,052