选择合适的模型,无论是 gpt-6-astra,还是 gpt-5.6-terra 这样较小的模型,都需要平衡 准确性、 延迟和 成本。本指南将介绍关键原则,并结合实际示例,帮助您做出有依据的选择。
核心原则
模型选择的原则很简单:
- 先优化准确性: 持续优化,直到达到您的准确性目标。
- 再优化成本和延迟: 在保持准确性的前提下,尽可能采用成本最低、速度最快的模型。
1. 优先关注准确性
首先,为您的用例设定明确的准确性目标,确定达到什么水平才算“足够好”,可以投入生产环境。您可以通过以下步骤来实现:
- 设定明确的准确性目标: 确定您要达到的准确性统计指标。
- 例如,90% 的客服来电需要在首次交互时得到正确分流。
- 构建评估数据集: 创建一个数据集,用于衡量模型是否达到这些目标。
- 继续上面的示例,收集 100 个交互样例,记录用户的请求、LLM 将其分流到哪里、正确的分流结果应该是什么,以及实际分流是否正确。
- 使用最强大的模型进行优化: 先使用当前能力最强的模型来实现您的准确性目标。记录所有响应,以便之后利用这些数据蒸馏出较小的模型。
- 使用检索增强生成来优化准确性
- 使用微调来优化一致性和行为
在此过程中,收集成对的提示和补全内容,用于评估、少样本学习或微调。这种做法称为 提示烘焙,有助于生成高质量样例,供以后使用。
有关更多相关方法和工具,请参阅我们的准确性优化指南。
设定切合实际的准确性目标
评估模型决策带来的经济影响,据此计算切合实际的准确性目标。例如,在虚假新闻分类场景中:
- 新闻分类正确: 如果模型分类正确,就能为您节省人工审查的费用,假设这笔费用为 $50。
- 新闻分类错误: 如果模型将一篇正常文章误判为虚假新闻,或漏掉一篇虚假新闻,就可能触发审查流程,甚至引发投诉,这可能会产生 $300 的费用。
在这个新闻分类示例中,准确率需要达到 85.8% 才能覆盖成本,因此将目标设为 90% 或更高,可以确保整体上获得投资回报。请根据您具体的成本结构,通过此类计算设定合理的准确性目标。
2. 优化成本和延迟
成本和延迟之所以放在次要位置,是因为如果模型无法达到您的准确性目标,讨论这些就没有意义。不过,一旦找到适合您用例的模型,就可以采用以下两种方法之一:
- 与较小模型的零样本或少样本表现进行比较: 换用更小、成本更低的模型,测试它是否能在降低成本和延迟的同时保持准确性。
- 模型蒸馏: 使用准确性优化过程中收集的数据,对较小的模型进行微调。
成本和延迟通常相互关联;减少 Token 数量和请求次数,一般也能加快处理速度。
这里主要可以考虑以下策略:
- 减少请求: 减少完成任务所需的请求次数。
- 尽量减少 Token: 减少输入 Token 数量,并通过优化缩短模型输出。
- 选择较小的模型: 使用能够兼顾降低成本和延迟、保持准确性的模型。
如需深入了解这些策略,请参阅我们的延迟优化指南。
例外情况
这些原则也有明确的例外。如果您的用例对成本或延迟极为敏感,请在开始测试前为这些指标设定阈值,然后排除超出阈值的模型。确定衡量标准后,这些指导原则将帮助您在约束范围内提高模型的准确性。
实际示例
为演示这些原则,我们将开发一个虚假新闻分类器,并设定以下目标指标。下面的实验使用 GPT-4o 系列的历史结果来展示工作流程;如果您现在开展评估,请先使用 gpt-6-astra,再与较小的模型或经过微调的模型进行比较。
- 准确率: 分类正确率达到 90%
- 成本: 每 1,000 篇文章的费用低于 $5
- 延迟: 每篇文章的处理时间保持在 2 秒以内
实验
为实现目标,我们进行了三次实验:
- 零样本: 使用
GPT-4o和一个基础提示处理 1,000 条记录,但未达到准确率目标。 - 少样本学习: 加入 5 个少样本示例后,达到了准确率目标,但提示中的 Token 增多,导致成本超出目标。
- 微调模型: 使用 1,000 个带标签的样例对
GPT-4o-mini进行微调,在延迟和准确率相近的情况下大幅降低了成本,达到了所有目标。
| 编号 | 方法 | 准确率 | 准确率目标 | 成本 | 成本目标 | 平均延迟 | 延迟目标 |
|---|---|---|---|---|---|---|---|
| 1 | gpt-4o 零样本 | 84.5% | $1.72 | < 1s | |||
| 2 | gpt-4o 少样本(n=5) | 91.5% | ✓ | $11.92 | < 1s | ✓ | |
| 3 | 使用 1000 个示例微调的 gpt-4o-mini | 91.5% | ✓ | $0.21 | ✓ | < 1s | ✓ |
结论
我们仅使用 1,000 个标注示例进行微调,并将 gpt-4o 换为 gpt-4o-mini,就以 不到原来 2% 的成本实现了同等性能 。
这个过程很重要。通常,您无法直接从微调开始,因为您还不确定微调是否适合所需的优化,或者没有足够的标注示例。先使用 gpt-6-astra 确定准确率目标,然后在需要考虑成本和延迟时,测试更小的模型或经过微调的模型。