For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航
Codex

Codex use case

分析数据集并交付报告

将杂乱数据转化为清晰的分析和可视化结果。

Difficulty 中级
Time horizon 1 小时

使用 ChatGPT Work 清理数据、联接数据源、探究问题、对结果建模,并生成一份清晰的报告,附上佐证图表和局限性说明。

最适合

  • 从杂乱文件入手,最终产出图表、备忘录、仪表板或报告的数据分析。
  • 需要清理数据、进行可靠联接、使用可解释模型或开展可复现分析的问题。
  • 需要产出可供他人审查和复用的成果的团队。

Contents

    ← 全部使用场景

    分析数据集并交付报告

    将杂乱数据转化为清晰的分析和可视化结果。

    使用 ChatGPT Work 清理数据、联接数据源、探究问题、对结果建模,并生成一份清晰的报告,附上佐证图表和局限性说明。

    中级
    1 小时

    使用 ChatGPT Work 清理数据、联接数据源、探究问题、对结果建模,并生成一份清晰的报告,附上佐证图表和局限性说明。

    中级
    1 小时

    最适合

    • 从杂乱文件入手,最终产出图表、备忘录、仪表板或报告的数据分析。
    • 需要清理数据、进行可靠联接、使用可解释模型或开展可复现分析的问题。
    • 需要产出可供他人审查和复用的成果的团队。

    技能与插件

    • Spreadsheets
      检查 CSV、TSV 和 Excel 文件,核对公式和联接,并创建可供审查的表格或图表。
    • 读取您在 Drive 中指定且已获批准的 Google 表格和源文件。
    • Data Analytics
      收集来源的背景信息,分析并验证数据,以及构建可复用的报告、仪表板、图表或笔记本。
    Skill Why use it
    Spreadsheets 检查 CSV、TSV 和 Excel 文件,核对公式和联接,并创建可供审查的表格或图表。
    Google Drive 读取您在 Drive 中指定且已获批准的 Google 表格和源文件。
    Data Analytics 收集来源的背景信息,分析并验证数据,以及构建可复用的报告、仪表板、图表或笔记本。

    入门提示

    使用 @Data Analytics 检查随附的房产成交和高速公路距离数据集,并判断高速公路附近房屋的房产价值是否更低。 说明每个数据源包含的内容,找出相关列和可能的联接键,并检查缺失值、重复项、未匹配记录和不完整数据。清理并联接输入数据,不得覆盖源文件或编造数值。 用清晰的佐证图表探索这个问题;如建模有助于分析,请先从可解释模型入手,并用通俗语言说明结果、假设和不确定性。返回一份简明的报告、笔记本或电子表格,将答案置于开头,注明所创建文件的名称,并标明任何可能改变结论的数据问题。
    使用 @Data Analytics 检查随附的房产成交和高速公路距离数据集,并判断高速公路附近房屋的房产价值是否更低。 说明每个数据源包含的内容,找出相关列和可能的联接键,并检查缺失值、重复项、未匹配记录和不完整数据。清理并联接输入数据,不得覆盖源文件或编造数值。 用清晰的佐证图表探索这个问题;如建模有助于分析,请先从可解释模型入手,并用通俗语言说明结果、假设和不确定性。返回一份简明的报告、笔记本或电子表格,将答案置于开头,注明所创建文件的名称,并标明任何可能改变结论的数据问题。

    简介

    数据分析的核心在于用数据为决策提供依据。目标不是为了分析而分析,而是产出能够帮助他人采取行动的成果:可以是供管理层使用的图表、供产品团队参考的实验结果报告、供研究人员查看的模型评估,或指导日常运营的仪表板。

    R for Data Science 推广开来的一种实用框架是循环式流程:先导入并整理数据,再在转换、可视化和建模之间反复迭代,逐步加深理解,之后再传达结果。

    ChatGPT Work 很适合这一工作流。它可以帮助您清理数据、探索假设、开展分析并产出可复现的成果。目标不是制作一次性笔记本,而是完成一份他人可以审查、信赖和重新运行的分析。

    定义您的用例

    选择一个您希望用数据回答的具体问题。问题越具体,就越容易确定恰当的输入、检查项和结果。

    贯穿示例:高速公路附近的房产价值

    下面以这个问题为例展开分析:

    高速公路附近房屋的房产估值低了多少?

    假设一个数据集包含房产价值或成交价,另一个包含位置、地块或距高速公路的距离信息。工作不只是运行模型,还要确保输入数据可信、记录联接过程、对结果进行压力测试,并最终产出他人可以使用的成果。

    您可以附加 CSV 或 Excel 工作簿,通过 @google-drive 指定一个已获批准的 Google 表格;如果数据存储在您的计算机上,也可以使用桌面 App。

    ChatGPT Work

    示例结果

    在一个虚构样本中,ChatGPT 将 11 笔房产成交记录与高速公路距离文件匹配,并标记出一笔没有匹配距离数据的成交记录。距高速公路一英里以内的房屋平均价值为 $500,000,而距高速公路两到五英里的房屋为 $600,000

    排除距离高速公路较远的房产中价格最高的一套后,差额仍为 $94,000。报告和图表说明了以下局限:样本量较小,未匹配的成交记录已被排除,而且该比较无法证明因果关系,也未控制社区、成交时间、交通流量或噪声等因素。

    导入数据

    首先附加文件,并让 ChatGPT 检查这些文件。这有助于回答以下基础但重要的问题:

    • 这里包含哪些文件格式?
    • 每个数据集似乎分别描述了什么?
    • 哪些列可能是目标变量、标识符、日期、位置或度量值?
    • 有哪些明显的数据质量问题?

    暂时不要让 ChatGPT 得出结论,先请它盘点并说明数据。

    整理并合并输入数据

    大多数实际工作都从这里开始。您有两个或更多数据集,主键并不明确,贸然合并可能导致数据丢失或产生重复项。

    让 ChatGPT 在执行合并前分析合并情况:

    • 检查候选键的唯一性。
    • 统计空值率和格式差异。
    • 统一明显不一致的格式,例如大小写、空白或地址格式。
    • 进行试联接并报告匹配率。
    • 在写入最终合并文件前,推荐最安全的合并策略。

    如果您需要确定最佳键,例如规范化地址、由几列组合而成的地块标识符或基于位置的联接,请在接受合并结果前,让 ChatGPT 说明其中的权衡和边界情况。

    使用图表探索数据

    选择模型前,先用图表了解数据。在贯穿示例中,应比较高速公路附近与较远处的房屋,检查异常值和缺失值模式,并判断这种表面上的效应是否源自社区构成、房屋面积或其他因素。

    确保每张图表都紧扣最初的问题。保存有用的比较结果,以便其他人检查分析过程。

    为问题建模

    并非每项分析都需要复杂模型。先从可解释的基准模型入手。

    对于高速公路这一问题,合理的初步做法是采用回归或其他可解释的模型,在控制房屋面积、房龄和位置等相关因素的同时,估算距高速公路的远近与房产价值之间的关系。

    请让 ChatGPT 明确说明以下内容:

    • 目标变量和各项特征的定义。
    • 要包含哪些控制变量,以及原因。
    • 数据泄漏风险和排除项。
    • 选择数据划分方式、评估方法或不确定性估计方法的依据。
    • 如何用通俗语言解读结果。

    即使第一个模型效果不佳,也仍有价值。它有助于判断问题究竟出在模型、特征、联接质量,还是问题本身。

    传达分析结果

    分析结果只有能被他人理解和使用,才有价值。请让 ChatGPT 生成受众所需的交付成果:

    • 面向技术协作者的 Markdown 备忘录。
    • 用于下游操作的电子表格或 CSV 文件。
    • 供决策者使用的排版文档或 PDF。
    • 用于可复用分析的笔记本、仪表板或静态报告。

    请让它注明注意事项和局限性。如果联接质量不理想、存在抽样偏差,或模型假设不稳健,交付成果中应明确说明。

    可选:设置 Python 环境

    如果项目需要可复用的脚本或笔记本,请让 ChatGPT 使用现有 Python 环境,或搭建一个精简、可复现的环境。保持源文件不变,并分别保存分析结果、图表和最终报告。在 ChatGPT Work 中分析附件前,您无需设置 Python 环境。

    建议的提示词

    加载数据集并说明内容

    审查我附加的数据文件,并说明每个文件包含什么内容。找出可能的目标列、日期字段、地块或位置标识符,识别文件格式、缺失信息和明显的数据质量问题。暂时不要得出结论。

    合并前检查联接方案

    检查这些数据集应如何联接。分析候选键,列出重复记录和未匹配记录,对明显的格式问题进行规范化处理,并说明最安全的联接方式。不要编造缺失值,也不要覆盖源文件。

    构建首个可解释模型

    建立模型,判断靠近高速公路是否与较低的房产价值相关。先从可解释的基准模型入手,在数据支持的情况下控制房屋面积、房龄和社区因素,并用通俗语言说明效应、不确定性和局限性。

    为利益相关方整理结果

    将这项分析整理成一份适合利益相关方阅读的简短报告。先给出结论,附上最有用的佐证图表,说明对数据和联接进行的检查,并明确指出其中的局限性或不确定性。保持源数据不变,并为所创建的文件命名。

    Tech stack

    Need

    分析技术栈

    Default options

    pandas 搭配 matplotlib seaborn

    Why it's needed

    是用于导入、数据剖析、联接、清理和首轮制图的不错默认选择。

    Need

    建模

    Default options

    statsmodels scikit-learn

    Why it's needed

    先从可解释的基线模型入手,再转向更复杂的预测模型。

    Need Default options Why it's needed
    分析技术栈 pandas 搭配 matplotlib seaborn 是用于导入、数据剖析、联接、清理和首轮制图的不错默认选择。
    建模 statsmodels scikit-learn 先从可解释的基线模型入手,再转向更复杂的预测模型。

    相关使用场景