Need
分析技术栈
Default options
pandas 搭配 matplotlib 或 seaborn
Why it's needed
是用于导入、数据剖析、联接、清理和首轮制图的不错默认选择。
.md to the page URL.
Codex use case
将杂乱数据转化为清晰的分析和可视化结果。
使用 ChatGPT Work 清理数据、联接数据源、探究问题、对结果建模,并生成一份清晰的报告,附上佐证图表和局限性说明。
将杂乱数据转化为清晰的分析和可视化结果。
使用 ChatGPT Work 清理数据、联接数据源、探究问题、对结果建模,并生成一份清晰的报告,附上佐证图表和局限性说明。
| Skill | Why use it |
|---|---|
| Spreadsheets | 检查 CSV、TSV 和 Excel 文件,核对公式和联接,并创建可供审查的表格或图表。 |
| Google Drive | 读取您在 Drive 中指定且已获批准的 Google 表格和源文件。 |
| Data Analytics | 收集来源的背景信息,分析并验证数据,以及构建可复用的报告、仪表板、图表或笔记本。 |
数据分析的核心在于用数据为决策提供依据。目标不是为了分析而分析,而是产出能够帮助他人采取行动的成果:可以是供管理层使用的图表、供产品团队参考的实验结果报告、供研究人员查看的模型评估,或指导日常运营的仪表板。
由 R for Data Science 推广开来的一种实用框架是循环式流程:先导入并整理数据,再在转换、可视化和建模之间反复迭代,逐步加深理解,之后再传达结果。
ChatGPT Work 很适合这一工作流。它可以帮助您清理数据、探索假设、开展分析并产出可复现的成果。目标不是制作一次性笔记本,而是完成一份他人可以审查、信赖和重新运行的分析。
选择一个您希望用数据回答的具体问题。问题越具体,就越容易确定恰当的输入、检查项和结果。
下面以这个问题为例展开分析:
高速公路附近房屋的房产估值低了多少?
假设一个数据集包含房产价值或成交价,另一个包含位置、地块或距高速公路的距离信息。工作不只是运行模型,还要确保输入数据可信、记录联接过程、对结果进行压力测试,并最终产出他人可以使用的成果。
您可以附加 CSV 或 Excel 工作簿,通过 @google-drive 指定一个已获批准的 Google 表格;如果数据存储在您的计算机上,也可以使用桌面 App。
在一个虚构样本中,ChatGPT 将 11 笔房产成交记录与高速公路距离文件匹配,并标记出一笔没有匹配距离数据的成交记录。距高速公路一英里以内的房屋平均价值为 $500,000,而距高速公路两到五英里的房屋为 $600,000。
排除距离高速公路较远的房产中价格最高的一套后,差额仍为 $94,000。报告和图表说明了以下局限:样本量较小,未匹配的成交记录已被排除,而且该比较无法证明因果关系,也未控制社区、成交时间、交通流量或噪声等因素。
首先附加文件,并让 ChatGPT 检查这些文件。这有助于回答以下基础但重要的问题:
暂时不要让 ChatGPT 得出结论,先请它盘点并说明数据。
大多数实际工作都从这里开始。您有两个或更多数据集,主键并不明确,贸然合并可能导致数据丢失或产生重复项。
让 ChatGPT 在执行合并前分析合并情况:
如果您需要确定最佳键,例如规范化地址、由几列组合而成的地块标识符或基于位置的联接,请在接受合并结果前,让 ChatGPT 说明其中的权衡和边界情况。
选择模型前,先用图表了解数据。在贯穿示例中,应比较高速公路附近与较远处的房屋,检查异常值和缺失值模式,并判断这种表面上的效应是否源自社区构成、房屋面积或其他因素。
确保每张图表都紧扣最初的问题。保存有用的比较结果,以便其他人检查分析过程。
并非每项分析都需要复杂模型。先从可解释的基准模型入手。
对于高速公路这一问题,合理的初步做法是采用回归或其他可解释的模型,在控制房屋面积、房龄和位置等相关因素的同时,估算距高速公路的远近与房产价值之间的关系。
请让 ChatGPT 明确说明以下内容:
即使第一个模型效果不佳,也仍有价值。它有助于判断问题究竟出在模型、特征、联接质量,还是问题本身。
分析结果只有能被他人理解和使用,才有价值。请让 ChatGPT 生成受众所需的交付成果:
请让它注明注意事项和局限性。如果联接质量不理想、存在抽样偏差,或模型假设不稳健,交付成果中应明确说明。
如果项目需要可复用的脚本或笔记本,请让 ChatGPT 使用现有 Python 环境,或搭建一个精简、可复现的环境。保持源文件不变,并分别保存分析结果、图表和最终报告。在 ChatGPT Work 中分析附件前,您无需设置 Python 环境。
加载数据集并说明内容
合并前检查联接方案
构建首个可解释模型
为利益相关方整理结果
Need
Default options
Why it's needed
Need
分析技术栈
Default options
pandas 搭配 matplotlib 或 seaborn
Why it's needed
是用于导入、数据剖析、联接、清理和首轮制图的不错默认选择。
Need
建模
Default options
Why it's needed
先从可解释的基线模型入手,再转向更复杂的预测模型。
| Need | Default options | Why it's needed |
|---|---|---|
| 分析技术栈 | pandas 搭配 matplotlib 或 seaborn | 是用于导入、数据剖析、联接、清理和首轮制图的不错默认选择。 |
| 建模 | statsmodels 或 scikit-learn | 先从可解释的基线模型入手,再转向更复杂的预测模型。 |