For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽
Codex

Codex use case

分析資料集並交付報告

將雜亂資料轉化為清楚的分析與視覺化成果。

Difficulty 中級
Time horizon 1 小時

使用 ChatGPT Work 清理資料、聯結資料來源、探索問題、對結果進行建模,並產出清楚的報告,附上佐證圖表與限制說明。

最適合

  • 從雜亂檔案開始,最終產出圖表、備忘錄、儀表板或報告的資料分析。
  • 需要清理資料、可靠聯結、可解釋模型或可重現分析的問題。
  • 需要可供他人審查及重複使用之成果的團隊。

Contents

    ← 所有使用案例

    分析資料集並交付報告

    將雜亂資料轉化為清楚的分析與視覺化成果。

    使用 ChatGPT Work 清理資料、聯結資料來源、探索問題、對結果進行建模,並產出清楚的報告,附上佐證圖表與限制說明。

    中級
    1 小時

    使用 ChatGPT Work 清理資料、聯結資料來源、探索問題、對結果進行建模,並產出清楚的報告,附上佐證圖表與限制說明。

    中級
    1 小時

    最適合

    • 從雜亂檔案開始,最終產出圖表、備忘錄、儀表板或報告的資料分析。
    • 需要清理資料、可靠聯結、可解釋模型或可重現分析的問題。
    • 需要可供他人審查及重複使用之成果的團隊。

    技能與外掛程式

    • Spreadsheets
      檢視 CSV、TSV 和 Excel 檔案,檢查公式與資料聯結,並建立可供審查的表格或圖表。
    • 讀取你在 Google 雲端硬碟中指定的已核准 Google 試算表與來源檔案。
    • Data Analytics
      蒐集來源上下文、分析並驗證資料,再建立可重複使用的報告、儀表板、圖表或筆記本。
    Skill Why use it
    Spreadsheets 檢視 CSV、TSV 和 Excel 檔案,檢查公式與資料聯結,並建立可供審查的表格或圖表。
    Google Drive 讀取你在 Google 雲端硬碟中指定的已核准 Google 試算表與來源檔案。
    Data Analytics 蒐集來源上下文、分析並驗證資料,再建立可重複使用的報告、儀表板、圖表或筆記本。

    起始提示詞

    使用 @Data Analytics 檢查附加的房產交易與高速公路距離資料集,判斷高速公路附近房屋的房產價值是否較低。 說明每個來源包含的內容,找出相關欄位和可能的聯結鍵,並檢查遺漏值、重複項目、未配對記錄及不完整資料。清理並聯結輸入資料,但不要覆寫來源檔案或杜撰任何值。 以清楚的佐證圖表探索此問題;若建模有助益,先從可解釋模型著手,並以淺白語言說明結果、假設和不確定性。請提供簡潔的報告、筆記本或試算表,將答案置於最前面,列出你建立的檔案名稱,並標示任何可能改變結論的資料問題。
    使用 @Data Analytics 檢查附加的房產交易與高速公路距離資料集,判斷高速公路附近房屋的房產價值是否較低。 說明每個來源包含的內容,找出相關欄位和可能的聯結鍵,並檢查遺漏值、重複項目、未配對記錄及不完整資料。清理並聯結輸入資料,但不要覆寫來源檔案或杜撰任何值。 以清楚的佐證圖表探索此問題;若建模有助益,先從可解釋模型著手,並以淺白語言說明結果、假設和不確定性。請提供簡潔的報告、筆記本或試算表,將答案置於最前面,列出你建立的檔案名稱,並標示任何可能改變結論的資料問題。

    簡介

    資料分析的核心,是運用資料來支援決策。目標不是為了分析而分析,而是產出能協助他人採取行動的成果:供管理層使用的圖表、供產品團隊參考的實驗結果摘要、供研究人員檢視的模型評估,或用於指引日常作業的儀表板。

    一個因 R for Data Science 而廣為人知的實用框架,是以迴圈方式進行:先匯入並整理資料,再反覆進行轉換、視覺化與建模,在傳達結果前逐步加深理解。

    ChatGPT Work 很適合這套工作流程。它能協助你清理資料、探索假設、進行分析,並產出可重現的成果。目標不是做出一次性的筆記本,而是完成一份讓他人能夠審查、信任並重新執行的分析。

    定義你的使用案例

    選定一個你想用資料回答的具體問題。問題越具體,就越容易找出合適的輸入資料、檢查項目和所需結果。

    貫穿本文的範例:高速公路附近的房產價值

    以下將以這個問題為例:

    高速公路附近房屋的估值低了多少?

    假設一個資料集包含房產價值或成交價格,另一個則包含位置、地籍或高速公路鄰近程度資訊。這項工作的重點不只是建立模型,還要確保輸入資料可信、記錄資料聯結方式、檢驗結果是否穩健,最後產出他人可使用的成果。

    你可以附加 CSV 檔案或 Excel 活頁簿,透過 @google-drive 指定已核准的 Google 試算表;若資料儲存在電腦上,也可以使用桌面版 App。

    ChatGPT Work

    範例結果

    在一個虛構樣本中,ChatGPT 將 11 筆房產交易與高速公路距離檔案成功配對,並標記一筆沒有相符距離資料的交易。距離高速公路 1 英里內的房屋平均房產價值為 $500,000,而距離 2 至 5 英里的房屋則為 $600,000

    排除距離高速公路較遠且價格最高的房產後,差距仍為 $94,000。報告與圖表說明樣本數很少、未配對的交易已排除,且這項比較無法確立因果關係,也未控制社區、成交時間、交通流量或噪音等因素。

    匯入資料

    先附加檔案並請 ChatGPT 檢查。這有助於回答以下幾個基本但重要的問題:

    • 這裡有哪些檔案格式?
    • 每個資料集看起來分別代表什麼?
    • 哪些欄位可能是目標變數、識別碼、日期、位置資訊或度量值?
    • 有哪些明顯的資料品質問題?

    暫時不要要求結論,而應先要求盤點資料並加以說明。

    整理並合併輸入資料

    大多數實務工作都從這裡開始。你有兩個以上的資料集,主鍵不明確,而貿然合併可能導致資料遺失或產生重複記錄。

    請 ChatGPT 在執行合併前先進行合併剖析:

    • 檢查候選鍵是否具有唯一性。
    • 計算空值率並檢查格式差異。
    • 統一處理英文字母大小寫、空白或地址格式等明顯的格式問題。
    • 執行試行聯結並回報配對率。
    • 在寫入最終合併檔案前,先提出最安全的合併策略建議。

    如果需要推導出最合適的鍵,例如標準化地址、由數個欄位組成的地籍識別碼,或位置聯結,請在接受合併結果前,要求 ChatGPT 說明其中的取捨與邊界情況。

    用圖表探索

    選擇模型前,先用圖表了解資料。在貫穿本文的範例中,比較高速公路附近的房屋和距離較遠的房屋、檢視離群值與遺漏值模式,並檢查表面上的效應是否其實反映了社區組成、房屋面積或其他因素。

    每張圖表都應緊扣原始問題。儲存有用的比較結果,讓其他人也能檢查這項分析。

    針對問題建立模型

    並非每項分析都需要複雜模型。先從可解讀的基準模型開始。

    針對高速公路這個問題,合理的第一步是使用迴歸或其他容易理解的模型,在控制房屋面積、屋齡和地點等相關因素後,估算鄰近高速公路與房產價值之間的關係。

    請 ChatGPT 明確交代以下事項:

    • 目標變數和特徵的定義。
    • 應納入哪些控制變數,以及原因。
    • 資料洩漏風險及排除項目。
    • 選擇資料分割方式、評估方法或不確定性估計方式的依據。
    • 如何以淺白語言解讀結果。

    如果第一個模型表現不佳,仍能提供有用資訊。這可以幫助你判斷問題出在模型、特徵、聯結品質,還是問題本身。

    傳達結果

    只有當其他人能理解並使用分析結果時,這項分析才有價值。請 ChatGPT 產出受眾所需的成果:

    • 供技術協作者使用的 Markdown 備忘錄。
    • 供後續作業使用的試算表或 CSV。
    • 供決策者使用的排版完善文件或 PDF。
    • 可重複利用的分析筆記本、儀表板或靜態報告。

    請它納入限制與注意事項。如果聯結品質不夠完善、存在抽樣偏誤,或模型假設不夠穩健,交付成果應明確指出。

    選用:設定 Python 環境

    如果專案需要可重複使用的指令碼或筆記本,請 ChatGPT 使用現有的 Python 環境,或設定一個精簡且可重現的環境。保持來源檔案不變,並分別儲存分析、圖表和最終報告。在 ChatGPT Work 中分析附加檔案時,無須預先設定 Python。

    建議提示詞

    載入資料集並說明其內容

    檢閱我附加的資料檔案,並說明每個檔案包含哪些內容。找出可能作為目標的欄位、日期、地籍或位置識別碼、檔案格式、缺漏資訊,以及明顯的資料品質問題。先不要下結論。

    合併資料前先檢查聯結方式

    檢查這些資料集應如何聯結。分析候選鍵的特性,列出重複及未配對的記錄,統一明顯不一致的格式,並說明最穩妥的聯結方式。不要虛構遺漏值,也不要覆寫來源檔案。

    建立第一個可解讀的模型

    建立模型,判斷鄰近高速公路是否與較低的房產價值相關。先從可解讀的基準模型開始;在資料足以支援的情況下,控制房屋面積、屋齡和社區等因素,並以淺白語言說明估計的效應、不確定性與限制。

    為利害關係人整理結果

    將這項分析整理成一份可直接提供給利害關係人的簡短報告。先給出答案,納入最有用的佐證圖表,說明資料內容與聯結檢查結果,並清楚標示任何限制或不確定性。保持來源資料不變,並列出你所建立的檔案名稱。

    Tech stack

    Need

    分析技術堆疊

    Default options

    pandas 搭配 matplotlib seaborn

    Why it's needed

    適合用於資料匯入、剖析、聯結、清理,以及製作第一輪圖表的預設工具組合。

    Need

    建模

    Default options

    statsmodels scikit-learn

    Why it's needed

    先從可解釋的基準模型著手,再進一步採用更複雜的預測模型。

    Need Default options Why it's needed
    分析技術堆疊 pandas 搭配 matplotlib seaborn 適合用於資料匯入、剖析、聯結、清理,以及製作第一輪圖表的預設工具組合。
    建模 statsmodels scikit-learn 先從可解釋的基準模型著手,再進一步採用更複雜的預測模型。

    相關使用案例