For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Selección de modelos

Elige el mejor modelo según el rendimiento y el costo.

Elegir el modelo adecuado, ya sea gpt-6-astra o una opción más pequeña como gpt-5.6-terra, requiere equilibrar la precisión, la latencia y el costo. Esta guía explica los principios clave para ayudarte a tomar decisiones informadas e incluye un ejemplo práctico.

Principios fundamentales

Los principios para seleccionar un modelo son simples:

  • Primero optimiza la precisión: mejora la precisión hasta alcanzar tu objetivo.
  • Después optimiza el costo y la latencia: busca mantener la precisión con el modelo más económico y rápido posible.

1. Concéntrate primero en la precisión

Comienza por definir un objetivo claro de precisión para tu caso de uso. Determina qué nivel de precisión sería “suficientemente bueno” para llevarlo a producción. Para ello, sigue estos pasos:

  • Definir un objetivo claro de precisión: determina el valor de precisión que quieres alcanzar.
    • Por ejemplo, el 90 % de las llamadas de atención al cliente deben clasificarse correctamente en la primera interacción.
  • Crear un conjunto de datos de evaluación: crea un conjunto de datos que te permita medir el rendimiento del modelo con respecto a estos objetivos.
    • Siguiendo el ejemplo anterior, recopila 100 ejemplos de interacciones que incluyan lo que pidió el usuario, la clasificación que asignó el LLM, cuál debería ser la clasificación correcta y si la clasificación asignada fue correcta o no.
  • Usar el modelo más potente para optimizar: comienza con el modelo más capaz disponible para alcanzar tus objetivos de precisión. Registra todas las respuestas para que podamos usarlas en la destilación de un modelo más pequeño.
    • Usa la generación aumentada por recuperación para optimizar la precisión
    • Usa el ajuste fino para optimizar la consistencia y el comportamiento

Durante este proceso, recopila pares de prompts y respuestas para usarlos en evaluaciones, aprendizaje con pocos ejemplos o ajuste fino. Esta práctica, conocida como prompt baking, te ayuda a generar ejemplos de alta calidad para usarlos más adelante.

Para conocer más métodos y herramientas, consulta nuestra guía de optimización de la precisión.

Definir un objetivo realista de precisión

Calcula un objetivo realista de precisión evaluando el impacto financiero de las decisiones del modelo. Por ejemplo, en un escenario de clasificación de noticias falsas:

  • Noticias clasificadas correctamente: si el modelo clasifica una noticia correctamente, te ahorra el costo de una revisión humana; supongamos que es de $50.
  • Noticias clasificadas incorrectamente: si clasifica erróneamente un artículo legítimo o no detecta una noticia falsa, puede desencadenar un proceso de revisión y una posible queja, lo que podría costarnos $300.

Nuestro ejemplo de clasificación de noticias necesitaría una precisión del 85,8 % para cubrir los costos, por lo que fijar un objetivo del 90 % o más garantiza un retorno de la inversión positivo en conjunto. Usa estos cálculos para establecer un objetivo de precisión adecuado según tu estructura de costos específica.

2. Optimiza el costo y la latencia

El costo y la latencia se consideran secundarios porque, si el modelo no alcanza tu objetivo de precisión, estos aspectos pierden relevancia. Sin embargo, una vez que tengas un modelo que funcione para tu caso de uso, puedes adoptar uno de estos dos enfoques:

  • Comparar con un modelo más pequeño sin ejemplos o con pocos ejemplos: sustituye el modelo por uno más pequeño y económico, y prueba si mantiene la precisión con un costo y una latencia menores.
  • Destilación de modelos: aplica ajuste fino a un modelo más pequeño con los datos recopilados durante la optimización de la precisión.

El costo y la latencia suelen estar relacionados; reducir los tokens y las solicitudes generalmente permite un procesamiento más rápido.

Las principales estrategias que debes considerar son:

  • Reducir las solicitudes: limita la cantidad de solicitudes necesarias para completar las tareas.
  • Minimizar los tokens: reduce la cantidad de tokens de entrada y optimiza las respuestas del modelo para que sean más cortas.
  • Seleccionar un modelo más pequeño: usa modelos que permitan reducir los costos y la latencia sin perder precisión.

Para profundizar en estas estrategias, consulta nuestra guía de optimización de la latencia.

Excepciones a la regla

Existen excepciones claras a estos principios. Si tu caso de uso es extremadamente sensible al costo o la latencia, establece umbrales para estas métricas antes de comenzar las pruebas y luego descarta los modelos que los superen. Una vez definidos los valores de referencia, estas pautas te ayudarán a mejorar la precisión del modelo dentro de tus restricciones.

Ejemplo práctico

Para demostrar estos principios, desarrollaremos un clasificador de noticias falsas con los siguientes objetivos para las métricas. El experimento que se presenta a continuación usa resultados históricos de la familia GPT-4o para mostrar el flujo de trabajo; para las evaluaciones actuales, comienza con gpt-6-astra y compáralo con modelos más pequeños o con ajuste fino.

  • Precisión: lograr un 90 % de clasificaciones correctas
  • Costo: gastar menos de $5 por cada 1000 artículos
  • Latencia: mantener el tiempo de procesamiento por debajo de 2 segundos por artículo

Experimentos

Realizamos tres experimentos para alcanzar nuestro objetivo:

  1. Sin ejemplos: usamos GPT-4o con un prompt básico para 1000 registros, pero no alcanzamos el objetivo de precisión.
  2. Aprendizaje con pocos ejemplos: incluimos 5 ejemplos y alcanzamos el objetivo de precisión, pero superamos el límite de costo debido al aumento de tokens en el prompt.
  3. Modelo con ajuste fino: aplicamos ajuste fino a GPT-4o-mini con 1000 ejemplos etiquetados y cumplimos todos los objetivos, con una latencia y una precisión similares, pero costos significativamente menores.
IDMétodoPrecisiónObjetivo de precisiónCostoObjetivo de costoLatencia promedioObjetivo de latencia
1gpt-4o sin ejemplos84,5 %$1,72< 1 s
2gpt-4o con pocos ejemplos (n=5)91,5 %$11,92< 1 s
3gpt-4o-mini con ajuste fino a partir de 1000 ejemplos91,5 %$0,21< 1 s

Conclusión

Al pasar de gpt-4o a gpt-4o-mini con ajuste fino, logramos un rendimiento equivalente por menos del 2 % del costo, usando solo 1000 ejemplos etiquetados.

Este proceso es importante: a menudo no puedes pasar directamente al ajuste fino porque no sabes si es la herramienta adecuada para la optimización que necesitas o no tienes suficientes ejemplos etiquetados. Comienza con gpt-6-astra para establecer tu objetivo de precisión y luego prueba modelos más pequeños o con ajuste fino cuando el costo y la latencia sean relevantes.