Por qué importan los metadatos
ChatGPT y Codex deciden cuándo llamar a tu herramienta según los metadatos que proporcionas. Los nombres, las descripciones y la documentación de parámetros bien redactados aumentan la exhaustividad ante prompts pertinentes y reducen las activaciones accidentales. Trata los metadatos como los textos de un producto: necesitan iteraciones, pruebas y análisis.
Reunir un conjunto de prompts de referencia
Antes de ajustar los metadatos, reúne un conjunto de datos etiquetados:
- Prompts directos: los usuarios mencionan explícitamente tu producto o fuente de datos.
- Prompts indirectos: los usuarios describen el resultado que buscan sin mencionar tu herramienta.
- Prompts negativos: casos en los que las herramientas integradas u otras herramientas deben atender la solicitud.
Documenta el comportamiento esperado para cada prompt (llamar a tu herramienta, no hacer nada o usar una alternativa). Volverás a usar este conjunto en las pruebas de regresión.
Redactar metadatos que orienten al modelo
Para cada herramienta:
- Nombre: combina el dominio con la acción (
calendar.create_event). - Descripción: comienza con “Usa esta herramienta cuando…” y señala los casos no permitidos (“No la uses para recordatorios”).
- Documentación de parámetros: describe cada argumento, incluye ejemplos y usa valores permitidos para las entradas con restricciones.
- Indicador de solo lectura: agrega la anotación
readOnlyHint: truea las herramientas que solo consultan o calculan información y nunca crean, actualizan, eliminan ni envían datos fuera de la conversación. - Indicador de operación destructiva: agrega la anotación
destructiveHint: falsea las herramientas que no eliminan ni sobrescriben datos del usuario. - Indicador de mundo abierto: agrega la anotación
openWorldHint: truecuando una herramienta acceda a internet público o a un conjunto abierto de entidades externas, incluidas las herramientas de solo lectura como la búsqueda web. Usafalsepara una herramienta limitada a una cuenta privada o un espacio de trabajo de alcance acotado, incluso si el servicio está alojado externamente.
Evaluar en modo de desarrollador
- En ChatGPT, activa el modo de desarrollador desde Configuración → Seguridad e inicio de sesión, y luego registra tu servidor MCP en Complementos de ChatGPT.
- Prueba todo el conjunto de prompts de referencia y registra el resultado: qué herramienta se seleccionó, qué argumentos se pasaron y si el componente se renderizó.
- Para cada prompt, registra la precisión (¿se ejecutó la herramienta correcta?) y la exhaustividad (¿se ejecutó la herramienta cuando debía?).
Si el modelo elige la herramienta equivocada, modifica las descripciones para destacar el caso de uso previsto o limitar el alcance de la herramienta.
Iterar de forma metódica
- Cambia un solo campo de metadatos a la vez para poder identificar a qué se deben las mejoras.
- Mantén un registro de las revisiones con marcas de tiempo y resultados de las pruebas.
- Comparte las diferencias con los revisores para detectar textos ambiguos antes de desplegarlos.
Después de cada revisión, repite la evaluación. Busca una precisión alta en los prompts negativos antes de intentar conseguir mejoras marginales en la exhaustividad.
Monitoreo en producción
Una vez que tu servidor MCP esté en funcionamiento:
- Revisa semanalmente los análisis de las llamadas a herramientas. Los aumentos repentinos en las confirmaciones de “herramienta equivocada” suelen indicar que los metadatos se han desajustado.
- Recopila los comentarios de los usuarios y actualiza las descripciones para aclarar los malentendidos habituales.
- Programa ejecuciones periódicas de los mismos prompts, especialmente después de agregar herramientas nuevas o cambiar campos estructurados.
Trata los metadatos como un recurso en constante evolución. Cuanto más cuidado pongas en la redacción y la evaluación, más fácil será descubrir e invocar tu herramienta.