管理控制台中的“洞察”可帮助您了解团队使用 ChatGPT Work 和 Codex 开展哪些工作,以及额度消耗在哪些方面。在工作空间概览中打开一个类别,即可查看其任务和使用情况。比较结果之前,请先检查各视图显示的数据范围。
使用这些视图找出需要评估的工作流,并与相关负责人一同评估。将使用情况和支出与团队记录结合起来,了解工作是否更省力、是否符合质量标准,或是否取得了更好的结果。
分析视图
管理控制台提供 ChatGPT Work 和 Codex 的分析功能。“使用情况”显示活动和消耗数据。“洞察”按类别和任务对使用情况进行归类。对于工程工作,“代码审查”显示审查活动及发现的问题。
如果您关注的是 Token,请使用“使用情况”中提供的 Token 指标。消息占比、额度占比和 Token 占比描述的是不同内容;比较或分享结果时,请保留这些标签,不要混用。
打开“洞察”
在管理控制台中,选择您的工作空间并打开 分析 > 洞察。您需要有权访问该工作空间的分析数据;您能看到的视图和数据取决于您的权限及已启用的功能。
查看结果之前,请检查工作空间、日期范围和可用的筛选条件。比较活动时,请保持这些设置一致。“洞察”仅提供自分类开始以来的历史数据。
使用场景与任务
在“概览”中,使用“使用场景 / 任务”切换控件,在大类与更具体的活动之间切换。在“使用场景”选项卡中,展开一个类别即可查看其任务。
选择图表中的使用场景或任务,即可打开其详情。使用“使用场景”表格进行比较时,还可以查看前 10 名以外的类别和任务。
一个类别可能包含多个工作流。在将其视为单一业务流程之前,请先检查其中的任务。如果部分活动尚未分类,请在描述结果时注明这一局限。
消息、额度与活跃用户
结合表格中的“消息”“额度”和“活跃用户”,了解各个类别或任务。如果出现抽样提示,所显示的计数反映的是抽样活动。请勿按比例放大这些计数来估算整个工作空间的活动总量。
消息 显示与某个类别或任务相关的消息数量。消息数量并不能说明团队完成了多少工作。
额度占比 显示某个类别或任务的额度消耗所占的比例。结合“额度”和“消息”一起查看,可了解消耗主要集中在哪些方面。
活跃用户 显示在某个类别或任务中活跃的人数。结合“消息”一起查看,可对照某个类别的使用人数及其产生的活动量。
如果某个类别的额度占比较大,请检查其任务、模型和设置。工作更复杂或模型选择不同,都可能是该类别额度消耗较多的原因。在判断这些消耗是否值得之前,请先查看团队取得的成果。
如果某个类别的活跃用户较少,请询问他们在该类别中如何开展工作,以及遇到了哪些困难。他们可能有值得分享的工作流,也可能需要更多支持。
类别详情
打开某个类别的详情,即可在右侧抽屉面板中查看其任务和使用情况明细。
查看该类别中的任务及每项任务使用的额度。按模型、推理和速度划分的明细显示了各选项在所选类别或任务中的额度占比。如果消耗发生变化,请询问团队的工作或这些设置是否有所改变。
如果提供了插件和技能调用数据,请查看该类别或任务的相关调用情况。这些计数涵盖所选日期范围和筛选条件内 ChatGPT Work 与 Codex 的活动。调用次数不等于消息数量或已完成的任务数。
分享分析发现时,请始终将估算值标注为估算值。归属于插件和技能的额度消耗可能重叠,因此请勿将这些视图中的数据相加来计算总投入。有关如何解读额度及其对账单的影响,请参阅 ChatGPT Work 使用情况与费用。
代码审查
如果您正在评估工程工作,请打开 代码审查 ,查看您的工作空间中可用的审查指标。
- 已审查的 PR 显示 Pull Request 审查活动。已审查的 Pull Request 不一定已合并或部署。
- 发现的问题 显示这些审查中发现的问题。请向审查者了解哪些发现有用,以及哪些已得到处理。
- 按优先级划分的问题、表情回应及回应的情感倾向 提供更多背景,帮助您了解发现的问题以及人们的反应。
计数为零可能表示没有活动,也可能表示报告数据存在缺失。解读计数之前,请检查日期范围,并确认是否包含了相关审查。
评估价值
选择团队在 ChatGPT Work 或 Codex 中使用的一个工作流。与业务负责人商定要改善的结果及其衡量方法。将“洞察”与客户简报、库存计划或 Pull Request 等团队记录结合起来查看。让实际开展这些工作的人员参与评估。
使用一致的报告周期,并留意任何抽样提示。一个类别可能包含多个工作流,活动计数也不能衡量已完成的工作量。以下示例展示了如何结合使用数据和工作流中的证据来考察价值。
修复缺陷
Codex 是否帮助工程师减少了排查和返工,更省力地修复缺陷?
选择某个服务中反复出现的一类缺陷,例如输入处理不正确。与熟悉该代码的工程师一起查看相关问题、修复和回归测试。
- 比较类似的修复。 记录复杂程度相近的缺陷在排查、实施修复和审查上花费的时间。将实际投入的工作时间与等待审查或发布的时间分开记录。
- 查看“洞察”。 打开“软件工程”,查找与排查相关的任务。查看您正在比较的时间段内的额度和活跃用户数据。
- 确认结果。 检查测试是否能复现缺陷,并在应用修复后通过。询问工程师纠正了哪些内容,并记录重新打开的问题或回归问题。
- 如果经确认有效的修复所需的总投入更少,就分享该工作流。 如果返工量仍然很高,请完善复现步骤或代码仓库上下文,然后再次比较。
添加测试
Codex 是否帮助团队减少了人工投入,同时覆盖重要的失败场景?
选择一个已知存在测试覆盖缺口的模块。在比较结果之前,就哪些行为和故障场景需要测试达成一致。
- 明确覆盖缺口。 列出尚未覆盖的行为,并记录添加同类测试所需的工作量。使用测试报告记录初始覆盖情况。
- 查看洞察。 在“软件工程”下查找相关任务。查看同一时段的额度消耗,以及可用的按模型和推理细分的数据。
- 检查测试。 请工程师检查断言能否捕获预期的故障。记录不稳定的测试结果、增加的运行时间,以及重写或维护测试所花的时间。
- 如果能以更少的工作量将有效的测试落地,就复用这种方法。 如果测试通过却未能捕获故障,请明确预期行为后重试。
重构代码
Codex 是否帮助团队在保持预期行为的同时完成重构?
选择一项范围明确的变更,例如在整个包中替换对某个已弃用 API 的调用。就哪些调用位置属于变更范围,以及团队将如何验证结果达成一致。
- 确定范围。 记录需要更新的调用位置,以及手动完成同类变更所需的工作量。对估算值加以标注,尤其是在这项工作此前被推迟的情况下。
- 查看洞察。 查看同一时段内相关的“软件工程”任务及其额度消耗。如果消耗较为突出,请查看可用的按模型和推理细分的数据。
- 验证变更。 审查代码差异,运行相关检查,并查找遗漏的调用位置或行为变化。将审查、纠正和后续修复计入工作量。
- 如果重构通过了约定的检查,就将其扩展到另一个包。 如果仍有过多的收尾工作,请先缩小变更范围或提供一个可用的示例。
客户研究
ChatGPT Work 是否帮助销售人员以更少的工作量编写准确的客户简报?
选择一个定期编写简报的销售团队。就每份简报应包含的内容达成一致,例如客户历史、当前重点事项以及要向客户提出的问题。
- 比较同类简报。 记录试用前和试用期间编写与审查简报所花的时间。使用相同的质量标准,并选择所需研究程度相近的客户。
- 查看洞察。 在“销售”下查找客户研究与规划。使用可用的群组筛选器聚焦该团队。查看同一时段的额度消耗、模型选择,以及任何可用的插件或技能活动数据。
- 与销售人员一起审查简报。 对照原始记录核实事实,并评估研究是否有助于为客户交流做好准备。将纠正内容所需的工作计入工作量,并跟踪节省的时间是否用于客户交流或跟进。
- 如果能以更少的工作量编写准确的简报,就分享这种方法。 如果缺少重要背景信息,请完善源材料或提供共享技能。使用 CRM 记录评估后续合格商机或销售情况的变化;仅凭洞察数据无法确定这种关联。
库存规划
ChatGPT Work 是否帮助团队以更少的手动工作制定可靠的库存计划?
选择一个重复进行的规划周期,例如为活动备货。就哪些产品和地点属于规划范围,以及团队将使用哪些销售和库存记录达成一致。
- 记录当前流程。 衡量收集记录、制定计划和修正计划所花的时间。记录同类周期中出现的库存短缺或库存过剩情况。
- 查看洞察。 查找与团队规划工作相符的类别和任务。查看同一时段的额度消耗和活跃用户数。在将该类别的使用量归于此工作流程之前,请与团队确认两者确实对应。
- 对照实际结果检查计划。 请库存负责人核实数量、假设和缺失的数据。将审查和纠正计入工作量。周期结束后,将计划库存量与实际销量及剩余库存进行比较。
- 如果计划可靠且所需工作量更少,就复用该工作流程。 如果库存短缺或库存过剩加剧,请重新检查输入信息和假设。使用库存与采购记录评估成本是否有所降低。
记录评估情况。 注明使用场景、负责人和报告周期,并记录基准、结果、额度消耗和局限。记录与团队商定的变更及复查日期。根据团队记录统计已完成的工作,并标注估算值。
评估投资回报率(ROI)时,请将改进带来的价值与 AI、设置、培训和持续支持的成本进行比较。将审查和纠正工作所花的时间计入其中。节省时间并不自动等于节省现金支出;请检查团队如何利用腾出的时间和精力。
提高使用限额之前,请查看当前限额、消耗情况,以及哪些工作需要更高的可用额度。已消耗的额度不一定会成为账单上的额外费用。请参阅ChatGPT Work 使用量与成本。
使用情况分析是了解您在 ChatGPT Work 和 Codex 上的投资回报的一个方面。它展示所选范围内的使用量和额度消耗。实际开展工作的团队则能解释发生了哪些变化、结果是否有所改善,以及改进带来了多大价值。结合这两方面的信息,决定扩大哪些工作流程的应用,以及团队在哪些方面需要更多支持。