Need
分析技術堆疊
Default options
pandas 搭配 matplotlib 或 seaborn
Why it's needed
適合用於資料匯入、剖析、聯結、清理,以及製作第一輪圖表的預設工具組合。
.md to the page URL.
Codex use case
將雜亂資料轉化為清楚的分析與視覺化成果。
使用 ChatGPT Work 清理資料、聯結資料來源、探索問題、對結果進行建模,並產出清楚的報告,附上佐證圖表與限制說明。
將雜亂資料轉化為清楚的分析與視覺化成果。
使用 ChatGPT Work 清理資料、聯結資料來源、探索問題、對結果進行建模,並產出清楚的報告,附上佐證圖表與限制說明。
| Skill | Why use it |
|---|---|
| Spreadsheets | 檢視 CSV、TSV 和 Excel 檔案,檢查公式與資料聯結,並建立可供審查的表格或圖表。 |
| Google Drive | 讀取你在 Google 雲端硬碟中指定的已核准 Google 試算表與來源檔案。 |
| Data Analytics | 蒐集來源上下文、分析並驗證資料,再建立可重複使用的報告、儀表板、圖表或筆記本。 |
資料分析的核心,是運用資料來支援決策。目標不是為了分析而分析,而是產出能協助他人採取行動的成果:供管理層使用的圖表、供產品團隊參考的實驗結果摘要、供研究人員檢視的模型評估,或用於指引日常作業的儀表板。
一個因 R for Data Science 而廣為人知的實用框架,是以迴圈方式進行:先匯入並整理資料,再反覆進行轉換、視覺化與建模,在傳達結果前逐步加深理解。
ChatGPT Work 很適合這套工作流程。它能協助你清理資料、探索假設、進行分析,並產出可重現的成果。目標不是做出一次性的筆記本,而是完成一份讓他人能夠審查、信任並重新執行的分析。
選定一個你想用資料回答的具體問題。問題越具體,就越容易找出合適的輸入資料、檢查項目和所需結果。
以下將以這個問題為例:
高速公路附近房屋的估值低了多少?
假設一個資料集包含房產價值或成交價格,另一個則包含位置、地籍或高速公路鄰近程度資訊。這項工作的重點不只是建立模型,還要確保輸入資料可信、記錄資料聯結方式、檢驗結果是否穩健,最後產出他人可使用的成果。
你可以附加 CSV 檔案或 Excel 活頁簿,透過 @google-drive 指定已核准的 Google 試算表;若資料儲存在電腦上,也可以使用桌面版 App。
在一個虛構樣本中,ChatGPT 將 11 筆房產交易與高速公路距離檔案成功配對,並標記一筆沒有相符距離資料的交易。距離高速公路 1 英里內的房屋平均房產價值為 $500,000,而距離 2 至 5 英里的房屋則為 $600,000。
排除距離高速公路較遠且價格最高的房產後,差距仍為 $94,000。報告與圖表說明樣本數很少、未配對的交易已排除,且這項比較無法確立因果關係,也未控制社區、成交時間、交通流量或噪音等因素。
先附加檔案並請 ChatGPT 檢查。這有助於回答以下幾個基本但重要的問題:
暫時不要要求結論,而應先要求盤點資料並加以說明。
大多數實務工作都從這裡開始。你有兩個以上的資料集,主鍵不明確,而貿然合併可能導致資料遺失或產生重複記錄。
請 ChatGPT 在執行合併前先進行合併剖析:
如果需要推導出最合適的鍵,例如標準化地址、由數個欄位組成的地籍識別碼,或位置聯結,請在接受合併結果前,要求 ChatGPT 說明其中的取捨與邊界情況。
選擇模型前,先用圖表了解資料。在貫穿本文的範例中,比較高速公路附近的房屋和距離較遠的房屋、檢視離群值與遺漏值模式,並檢查表面上的效應是否其實反映了社區組成、房屋面積或其他因素。
每張圖表都應緊扣原始問題。儲存有用的比較結果,讓其他人也能檢查這項分析。
並非每項分析都需要複雜模型。先從可解讀的基準模型開始。
針對高速公路這個問題,合理的第一步是使用迴歸或其他容易理解的模型,在控制房屋面積、屋齡和地點等相關因素後,估算鄰近高速公路與房產價值之間的關係。
請 ChatGPT 明確交代以下事項:
如果第一個模型表現不佳,仍能提供有用資訊。這可以幫助你判斷問題出在模型、特徵、聯結品質,還是問題本身。
只有當其他人能理解並使用分析結果時,這項分析才有價值。請 ChatGPT 產出受眾所需的成果:
請它納入限制與注意事項。如果聯結品質不夠完善、存在抽樣偏誤,或模型假設不夠穩健,交付成果應明確指出。
如果專案需要可重複使用的指令碼或筆記本,請 ChatGPT 使用現有的 Python 環境,或設定一個精簡且可重現的環境。保持來源檔案不變,並分別儲存分析、圖表和最終報告。在 ChatGPT Work 中分析附加檔案時,無須預先設定 Python。
載入資料集並說明其內容
合併資料前先檢查聯結方式
建立第一個可解讀的模型
為利害關係人整理結果
Need
Default options
Why it's needed
Need
分析技術堆疊
Default options
pandas 搭配 matplotlib 或 seaborn
Why it's needed
適合用於資料匯入、剖析、聯結、清理,以及製作第一輪圖表的預設工具組合。
Need
建模
Default options
Why it's needed
先從可解釋的基準模型著手,再進一步採用更複雜的預測模型。
| Need | Default options | Why it's needed |
|---|---|---|
| 分析技術堆疊 | pandas 搭配 matplotlib 或 seaborn | 適合用於資料匯入、剖析、聯結、清理,以及製作第一輪圖表的預設工具組合。 |
| 建模 | statsmodels 或 scikit-learn | 先從可解釋的基準模型著手,再進一步採用更複雜的預測模型。 |