For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal
30 dic 2025 General

OpenAI para desarrolladores en 2025

Un resumen de fin de año de los principales cambios en modelos, API y plataforma para crear agentes listos para producción.

Autores: Vaibhav (VB) Srivastav, Katia Gil Guzman

OpenAI para desarrolladores en 2025

2025 no se definió por el lanzamiento de un solo modelo: fue el año en que resultó más fácil usar la IA en producción. A medida que los modelos mejoraban en planificación, uso de herramientas y tareas de mayor duración, más equipos pasaron de “dar instrucciones paso a paso mediante prompts” a delegar trabajo a los agentes.

Para los desarrolladores, ese cambio se manifestó en varios aspectos concretos:

  • El razonamiento se convirtió en un parámetro de ajuste fundamental y se integró cada vez más en los modelos de chat de uso general.
  • La multimodalidad (documentos, audio, imágenes, video) pasó a ser una capacidad central de la API.
  • Los componentes para crear agentes (API Responses, Agents SDK, AgentKit) facilitaron la puesta en producción y la operación de flujos de trabajo de varios pasos.
  • Codex hizo posible desarrollar más rápido y mejor que nunca.

En resumen

  • El gran cambio fue la combinación de API diseñadas desde el inicio para agentes y mejores modelos capaces de realizar tareas más complejas que requieren razonamiento y uso de herramientas.
  • Codex maduró tanto en modelos como en herramientas, al combinar el razonamiento de GPT-5.2-Codex a escala de repositorio con una CLI lista para producción y flujos de trabajo en Web y el IDE para tareas de programación de larga duración.
  • Las mejoras en las herramientas facilitaron la conexión de los modelos con sistemas reales y redujeron las dificultades de integración.
  • Las entradas y salidas multimodales (PDF, imágenes, audio, video) se convirtieron en una opción práctica habitual en los flujos de trabajo de principio a fin.
  • Las evaluaciones, los calificadores y las funciones de ajuste maduraron hasta formar un ciclo más repetible de “medir -> mejorar -> lanzar”.

Sigue leyendo para conocer las principales novedades de 2025 en modelos, API y plataforma, y descubrir cómo pueden ayudarte a lanzar agentes listos para producción.

Razonamiento: de modelos separados a una línea unificada

Tras presentar el paradigma del razonamiento a finales de 2024, cuando empezamos a darles a los modelos “tiempo para pensar”, a principios de 2025 los modelos de razonamiento constituían una familia diferenciada. Modelos como o1, o3 y o4-mini dejaron claro que dedicar más recursos de cómputo a pensar antes de responder podía mejorar drásticamente la confiabilidad en trabajos complejos de varios pasos.

También cabe destacar que o3-mini fue una de las primeras señales de que el razonamiento no sería una función exclusiva de los modelos de vanguardia; también podía ofrecerse en formatos económicos y fáciles de usar para los desarrolladores.

Entre mediados y finales de 2025, la gran tendencia fue la convergencia: la profundidad del razonamiento, el uso de herramientas y la calidad de la conversación se integraban cada vez más en una misma línea de modelos insignia (para la mayoría de los equipos, “elegir un modelo” pasó a depender más del equilibrio entre costo, latencia y calidad que de escoger entre familias fundamentalmente distintas).

Los lanzamientos centrados en el razonamiento, como o1, o3 / o4-mini y o3-mini, ayudaron a que los desarrolladores pudieran ajustar el equilibrio entre “pensar más a fondo o responder más rápido”. A lo largo del año, esas ideas se incorporaron cada vez más a la familia GPT-5.x, unificando la inteligencia general, la profundidad del razonamiento, la especialización en programación y la multimodalidad en una sola línea de modelos.

Multimodalidad: audio, visión, imágenes y video

A finales de 2025, multimodal dejó de significar “puede aceptar una imagen como entrada” y pasó a significar “puedes crear un producto completo que combine distintas modalidades”, a menudo en un solo flujo de trabajo.

Audio + tiempo real

  • Los modelos de audio de nueva generación mejoraron la precisión de la conversión de voz a texto e incorporaron un mayor control sobre la conversión de texto a voz, lo que permitió crear flujos de procesamiento de voz listos para producción.
  • La Realtime API alcanzó la disponibilidad general y permitió el streaming bidireccional de audio de baja latencia, lo que hizo viable crear agentes de voz en vivo e interfaces conversacionales con la calidad necesaria para producción.

Imágenes

  • GPT Image 1 inauguró una nueva generación de modelos de generación de imágenes capaces de producir imágenes de alta calidad y ediciones estructuradas, con una sólida comprensión del mundo y un mejor seguimiento de instrucciones.
  • La alta fidelidad a la imagen de entrada permitió conservar de forma más consistente detalles como rostros y logotipos al editar imágenes.
  • GPT Image 1 mini hizo más económica la generación nativa de imágenes.
  • GPT Image 1.5, nuestro modelo de generación más avanzado, marcó un salto en la calidad de las imágenes y la consistencia de las ediciones.
  • La generación de imágenes como herramienta en la API Responses permitió crear imágenes como parte de conversaciones de varios turnos, en combinación con otras herramientas.

Video

  • Los modelos Sora 2 y Sora 2 Pro introdujeron la generación de video de mayor fidelidad, con una mejor coherencia temporal y soporte para crear remixes.
  • La Video API ofreció generación y edición de video mediante v1/videos, convirtiendo el video en una modalidad plenamente integrada en la API, junto con el texto, las imágenes y el audio.

PDF y documentos

  • Las entradas en PDF permitieron ejecutar flujos de trabajo con uso intensivo de documentos directamente en la API.
  • El uso de PDF mediante URL simplificó el proceso al permitir hacer referencia a documentos sin cargarlos.

Por qué importa: ahora puedes recurrir a la plataforma de OpenAI no solo para texto y visión, sino también para tus flujos de trabajo de generación de imágenes y video, así como para casos de uso de voz a voz.

Codex

En 2025, Codex dejó de ser solo un modelo de programación y se convirtió en tu compañero de ingeniería de software: conectó modelos, herramientas locales y la nube para ayudar a los desarrolladores a abordar tareas de programación más largas y complejas.

Modelos

Los primeros modelos de razonamiento demostraron mejoras importantes en tareas de programación complejas (ediciones en varios archivos, depuración, planificación). Entre mediados y finales de 2025, estas capacidades se consolidaron en la familia GPT-5, y GPT-5.2-Codex se convirtió en la opción predeterminada más reciente para la generación de código, la revisión y el razonamiento a escala de repositorio. Ya no era un modelo separado de los de uso general, sino una variante especializada dentro de ellos.

CLI

Codex CLI, de código abierto (GitHub), llevó la programación con agentes directamente a los entornos locales, lo que permitió a los desarrolladores ejecutar Codex sobre repositorios reales, revisar cambios de forma iterativa y aplicar ediciones a archivos con supervisión humana. Esto hizo que las tareas de programación de larga duración fueran viables en los flujos de trabajo cotidianos.

También se volvió más fácil integrar Codex en procesos que van más allá del uso interactivo, con soporte integrado para patrones de automatización repetibles, como usar Codex mediante scripts.

Seguridad, control e integraciones

Codex se adaptó a las exigencias de la puesta en producción: el entorno aislado y los modos de aprobación facilitaron mantener la participación humana. Al mismo tiempo, el soporte para AGENTS.md y MCP hizo más fácil adaptar Codex a tu repositorio, ampliarlo con herramientas y contexto de terceros, e incluso orquestar Codex mediante Agents SDK (ejecutando la CLI como un servidor MCP).

Actualización del 5 de septiembre de 2026: se eliminó el servidor MCP de Codex. Consulta la guía de migración para conocer las opciones de integración actuales.

Web, nube e IDE

Más allá de la CLI, Codex amplió el soporte para sesiones más largas y la resolución iterativa de problemas en Web + nube y la extensión para IDE, agilizando el ciclo entre el razonamiento conversacional y los cambios concretos en el código. Los equipos también podían automatizar partes del flujo de trabajo con Codex Autofix en CI.

Por qué importa: a finales de 2025, Codex funcionaba menos como “un modelo al que le das prompts” y más como un entorno de programación que combinaba modelos capaces de razonar con herramientas que los desarrolladores ya usan.

Cambio en la plataforma: API Responses y componentes para crear agentes

Uno de los cambios más importantes de la plataforma en 2025 fue la transición hacia API diseñadas desde el inicio para agentes.

La API Responses facilitó el desarrollo para la nueva generación de modelos:

  • Soporte para múltiples entradas y salidas, incluidas distintas modalidades
  • Soporte para controles y resúmenes de razonamiento
  • Mejor soporte para llamadas a herramientas, incluso durante el razonamiento

Sobre esa base, 2025 también trajo componentes de mayor nivel, como Agents SDK, de código abierto, y AgentKit, que facilitaron la creación y orquestación de agentes.

También se volvió más fácil gestionar el estado y la persistencia:

Por qué importa: crear agentes de varios pasos y flujos de trabajo de larga duración ahora requiere menos código de integración personalizado y menos gestión del estado.

Además de componentes básicos sólidos, presentamos un conjunto de potentes herramientas integradas para maximizar la utilidad de los modelos.


Herramientas: de la búsqueda web a los flujos de trabajo

En 2025, lanzamos un conjunto de capacidades estandarizadas y combinables que permiten a los agentes realizar tareas útiles de forma segura.

  • La búsqueda web ofreció un componente básico y sencillo de recuperación para los agentes que necesitan información actualizada y citas.
  • La búsqueda de archivos (almacenes vectoriales) ofreció un componente básico de RAG alojado y disponible de forma predeterminada que se integra fácilmente con Responses y los resultados estructurados.
  • El intérprete de código ejecutaba Python en contenedores aislados mediante un sandbox para trabajar con datos, transformar archivos y depurar de forma iterativa.
  • El uso de la computadora permitió crear ciclos de automatización de “hacer clic/escribir/desplazarse” (preferiblemente combinados con un entorno aislado y participación humana durante el proceso).

Por qué es importante: los agentes pueden recuperar información, realizar cálculos y actuar de forma confiable sin que cada equipo tenga que reinventar un entorno de ejecución de herramientas a medida.

Ejecutar y escalar: asincronía, eventos y controles de costos

Cuando los agentes pasaron de realizar una “sola solicitud” a ejecutar “tareas de varios pasos”, los equipos de producción necesitaron componentes básicos para gestionar los costos, la latencia y la confiabilidad.

  • El almacenamiento de prompts en caché redujo la latencia y los costos de entrada cuando los prompts comparten prefijos largos y repetidos (prompts del sistema, herramientas, esquemas).
  • El modo en segundo plano permitió generar respuestas de larga duración sin mantener abierta una conexión con el cliente.
  • Los webhooks permitieron pasar de “consultar periódicamente el estado de todo” a sistemas basados en eventos (finalización de un lote, de una respuesta en segundo plano o de un ajuste fino).
  • Los límites de solicitudes y las recomendaciones para optimizar las cargas de trabajo maduraron a medida que se ampliaban los niveles de uso y las familias de modelos.

Por qué es importante: crear agentes pasó a depender tanto del diseño de sistemas (asincronía + eventos + presupuestos) como del diseño de prompts.

Estándares abiertos y componentes de código abierto para crear agentes

Además de la consolidación de las API, en 2025 se puso énfasis en la interoperabilidad y la capacidad de combinar componentes en los sistemas con agentes.

  • El Agents SDK de código abierto para Python (GitHub) y TypeScript (GitHub) estableció componentes básicos y prácticos para el uso de herramientas, las transferencias entre agentes, las medidas de protección y el seguimiento de trazas. Además, es independiente del proveedor y cuenta con procedimientos documentados para usar modelos de proveedores distintos de OpenAI.
  • AgentKit incorporó herramientas de mayor nivel de abstracción para el desarrollo de agentes (entre ellas, Agent Builder, ChatKit, Connector Registry y ciclos de evaluación) para los equipos que quieren lanzar e iterar más rápido.
  • En cuanto a los estándares, OpenAI impulsó AGENTS.md (especificación) y participó en la AAIF (Agentic AI Foundation), junto con otros estándares del ecosistema como Model Context Protocol (MCP) y las habilidades. El valor para los desarrolladores: herramientas para agentes más portables y menos integraciones específicas conforme el ecosistema adopta convenciones compartidas.

Además de nuestro trabajo en agentes y estándares relacionados, presentamos el Apps SDK, un framework de código abierto que amplía Model Context Protocol (MCP) para que los desarrolladores puedan crear interfaces de usuario junto con sus servidores MCP y definir tanto la lógica como la interfaz interactiva de aplicaciones que pueden ejecutarse en clientes como ChatGPT.

Por qué es importante: los desarrolladores pueden crear agentes menos acoplados a un único entorno de ejecución o interfaz de usuario e integrar más fácilmente agentes basados en OpenAI en sistemas heterogéneos.

Modelos de pesos abiertos

Además de las API alojadas, OpenAI lanzó modelos de pesos abiertos diseñados para la transparencia, la investigación y el despliegue en instalaciones propias o con alojamiento propio, sin perder sus sólidas capacidades de razonamiento y seguimiento de instrucciones.

  • Modelos de razonamiento gpt-oss 120b & 20b diseñados para el alojamiento propio y los despliegues en instalaciones propias.
  • Modelos de seguridad y políticas gpt-oss-safeguard 120b & 20b pensados para ejecutarse junto con gpt-oss.

Evaluación, ajuste y lanzamientos seguros

Para cerrar

A lo largo de 2025, nos enfocamos de forma constante en algunos aspectos para facilitar que los desarrolladores creen y lancen soluciones en nuestra plataforma:

  • Razonamiento a gran escala y controlable como capacidad central
  • Una interfaz de API unificada y diseñada para agentes desde el inicio
  • Componentes abiertos y estándares de interoperabilidad emergentes
  • Amplia compatibilidad multimodal con texto, imágenes, audio, video y documentos
  • Herramientas de producción más sólidas para la evaluación, el ajuste y el despliegue

Si estás empezando un nuevo desarrollo o modernizando una integración, estas son “opciones predeterminadas” razonables para tu tarea.

  • Uso general (texto + multimodal): GPT-5.2 para chat, trabajo con contextos largos y entradas multimodales.
  • Razonamiento más profundo / cargas de trabajo que requieren alta confiabilidad: GPT-5.2 Pro para la planificación y las tareas en las que la calidad justifica usar recursos de cómputo adicionales.
  • Programación e ingeniería de software: GPT-5.2-Codex para la generación y revisión de código, el razonamiento sobre repositorios completos y los agentes de programación que usan herramientas.
  • Generación y edición de imágenes: GPT Image 1.5 para generar imágenes de mayor fidelidad y editarlas de forma iterativa.
  • Voz en tiempo real: gpt-realtime para interacciones de voz a voz de baja latencia y agentes de voz en vivo.

Para obtener información actualizada sobre la disponibilidad y los niveles, consulta la página oficial de comparación de modelos.

Estas actualizaciones sientan las bases para lo que viene. Gracias por crear con nosotros en 2025. Nos entusiasma ver lo que crearás en 2026.