For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
メインナビゲーション
Codex

Codex use case

データセットの分析とレポートの作成

雑然としたデータを明確な分析と可視化に変えます。

Difficulty 中級
Time horizon 1時間

ChatGPT Work を使ってデータをクリーニングし、ソースを結合して問いを掘り下げ、結果をモデル化したうえで、補足チャートと注意事項を含む明確なレポートを作成します。

最適な用途

  • 雑然としたファイルから始まり、チャート、メモ、ダッシュボード、レポートのいずれかに至るデータ分析
  • クリーニング、信頼性の高い結合、解釈可能なモデル、再現可能な分析が必要な問い
  • 他の人がレビューして再利用できる成果物を必要とするチーム

Contents

    ← すべてのユースケース

    データセットの分析とレポートの作成

    雑然としたデータを明確な分析と可視化に変えます。

    ChatGPT Work を使ってデータをクリーニングし、ソースを結合して問いを掘り下げ、結果をモデル化したうえで、補足チャートと注意事項を含む明確なレポートを作成します。

    中級
    1時間

    ChatGPT Work を使ってデータをクリーニングし、ソースを結合して問いを掘り下げ、結果をモデル化したうえで、補足チャートと注意事項を含む明確なレポートを作成します。

    中級
    1時間

    最適な用途

    • 雑然としたファイルから始まり、チャート、メモ、ダッシュボード、レポートのいずれかに至るデータ分析
    • クリーニング、信頼性の高い結合、解釈可能なモデル、再現可能な分析が必要な問い
    • 他の人がレビューして再利用できる成果物を必要とするチーム

    スキルとプラグイン

    • Spreadsheets
      CSV、TSV、Excel ファイルを調べ、数式と結合を確認し、レビュー可能な表やチャートを作成します。
    • Drive 内で指定した、承認済みの Google スプレッドシートとソースファイルを読み取ります。
    • Data Analytics
      ソースの背景情報を収集し、データを分析・検証して、再利用可能なレポート、ダッシュボード、チャート、ノートブックを作成します。
    Skill Why use it
    Spreadsheets CSV、TSV、Excel ファイルを調べ、数式と結合を確認し、レビュー可能な表やチャートを作成します。
    Google Drive Drive 内で指定した、承認済みの Google スプレッドシートとソースファイルを読み取ります。
    Data Analytics ソースの背景情報を収集し、データを分析・検証して、再利用可能なレポート、ダッシュボード、チャート、ノートブックを作成します。

    開始用プロンプト

    @Data Analytics を使って、添付した不動産売却データセットと高速道路までの距離データセットを調べ、高速道路に近い住宅ほど不動産価値が低いかどうかを判断してください。 各ソースの内容を説明し、関連する列と結合キーの候補を特定して、欠損値、重複、未照合レコード、不完全なデータがないか確認してください。ソースファイルを上書きしたり、存在しない値を作成したりせずに、入力データをクリーニングして結合してください。 明確な補足チャートを使って問いを検討し、モデリングが有用な場合は解釈可能なモデルから始め、結果、前提、不確実性を平易な言葉で説明してください。回答を最初に示した簡潔なレポート、ノートブック、スプレッドシートのいずれかを返し、作成したファイル名を明記して、結論が変わる可能性のあるデータ上の問題があれば示してください。
    @Data Analytics を使って、添付した不動産売却データセットと高速道路までの距離データセットを調べ、高速道路に近い住宅ほど不動産価値が低いかどうかを判断してください。 各ソースの内容を説明し、関連する列と結合キーの候補を特定して、欠損値、重複、未照合レコード、不完全なデータがないか確認してください。ソースファイルを上書きしたり、存在しない値を作成したりせずに、入力データをクリーニングして結合してください。 明確な補足チャートを使って問いを検討し、モデリングが有用な場合は解釈可能なモデルから始め、結果、前提、不確実性を平易な言葉で説明してください。回答を最初に示した簡潔なレポート、ノートブック、スプレッドシートのいずれかを返し、作成したファイル名を明記して、結論が変わる可能性のあるデータ上の問題があれば示してください。

    はじめに

    データ分析の本質は、データを意思決定に役立てることです。分析自体が目的ではありません。目指すのは、行動につながる成果物を作ることです。たとえば、経営層向けのチャート、プロダクトチーム向けの実験結果のまとめ、研究者向けのモデル評価、日々の業務判断に役立つダッシュボードなどです。

    書籍 R for Data Science で広く知られるようになった有用な枠組みは、ループです。データをインポートして整えた後、変換、可視化、モデリングを繰り返して理解を深め、最後に結果を伝えます。

    ChatGPT Work は、このワークフローとの相性に優れています。データのクリーニング、仮説の検討、分析の実行、再現可能な成果物の作成を支援します。目指すのは、使い切りのノートブックではなく、他の人がレビューし、信頼し、再実行できる分析です。

    ユースケースの定義

    データを使って答えたい具体的な問いを 1 つ選びます。問いが具体的であるほど、適切な入力データ、確認項目、成果を特定しやすくなります。

    例:高速道路付近の不動産価値

    例として、次の問いを検討します:

    高速道路に近い住宅は、不動産評価額がどの程度低いのでしょうか?

    一方のデータセットに不動産評価額や売却価格が含まれ、もう一方に所在地、区画、高速道路への近接度に関する情報が含まれているとします。作業はモデルを実行するだけではありません。入力データの信頼性を確保し、結合の過程を文書化し、結果の堅牢性を検証して、最後に他の人が利用できる成果物にまとめます。

    CSV や Excel ワークブックを添付したり、承認済みの Google スプレッドシートを @google-drive で指定したりできます。また、データがコンピューターに保存されている場合は、デスクトップアプリを使用できます。

    ChatGPT Work

    結果の例

    架空のサンプルでは、ChatGPT は 11 件の不動産売却記録を高速道路までの距離データファイルと照合し、対応する距離データがない 1 件の売却記録にフラグを付けます。高速道路から 1 マイル以内の住宅の平均価格は $500,000 で、2~5 マイル離れた住宅の $600,000 と比べて低くなっています。

    高速道路から遠い住宅のうち最も高額な物件を除外しても、差は $94,000 残ります。レポートとチャートでは、サンプルが少ないこと、照合できなかった売却記録を除外したこと、さらにこの比較から因果関係は立証できず、地域、売却時期、交通量、騒音の影響も調整していないことを説明しています。

    データのインポート

    まずファイルを添付し、ChatGPT に内容を調べるよう依頼します。これは、基本的ですが重要な次の点を確認するのに役立ちます:

    • どのようなファイル形式のデータがあるか?
    • 各データセットは何を表していると考えられるか?
    • 目的変数、識別子、日付、場所、測定値に該当する可能性がある列はどれか?
    • 明らかなデータ品質の問題はどこにあるか?

    この段階ではまだ結論を求めず、まず内容の一覧と説明を求めます。

    入力データの整理と結合

    実際の作業の多くはここから始まります。データセットが 2 つ以上あり、主キーが明確でない場合、安易に結合するとデータが失われたり、重複が生じたりする可能性があります。

    結合を実行する前に、その処理をプロファイリングするよう ChatGPT に依頼します:

    • 候補キーの一意性を確認
    • 欠損値の割合と書式の違いを測定
    • 大文字と小文字、空白、住所表記などに見られる明らかな書式上の問題を正規化
    • 試行的な結合を実行し、照合率を報告
    • 最終的な結合済みファイルを書き出す前に、最も安全な結合戦略を提案

    正規化した住所、複数の列を組み合わせた区画識別子、位置情報による結合などから最適なキーを導出する必要がある場合は、結合結果を採用する前に、トレードオフとエッジケースを説明するよう ChatGPT に依頼します。

    チャートによる探索

    モデルを選ぶ前に、チャートを使ってデータを理解します。この例では、高速道路に近い住宅と遠い住宅を比較し、外れ値と欠損値のパターンを調べ、見かけ上の効果が地域の構成、住宅の広さ、その他の要因を反映したものではないかを確認します。

    各チャートを元の問いに結び付けます。他の人が分析を確認できるよう、有用な比較結果を保存します。

    問いのモデル化

    すべての分析に複雑なモデルが必要なわけではありません。まずは解釈可能なベースラインから始めます。

    高速道路に関する問いでは、まず、住宅の広さ、築年数、所在地などの関連要因を調整しながら、高速道路への近さと不動産価値の関係を推定する回帰モデルなど、透明性の高いモデルを試すのが妥当です。

    ChatGPT に次の点を明示するよう依頼します:

    • 目的変数と特徴量の定義
    • どの制御変数を含めるかと、その理由
    • データリークのリスクと除外対象
    • データ分割、評価方法、不確実性の推定方法をどのように選んだか
    • 結果が何を意味するかの平易な説明

    最初のモデルの性能が低くても、それは有用な情報です。問題の原因がモデル、特徴量、結合の品質、問い自体のどれにあるかを判断する材料になります。

    結果の共有

    分析は、ほかの人が活用できてこそ意味があります。受け手が必要とする成果物を作成するよう ChatGPT に依頼します:

    • 技術担当者向けの Markdown メモ
    • 後続の処理に使用するスプレッドシートまたは CSV
    • 意思決定者向けに書式を整えた文書または PDF
    • 分析を再利用するためのノートブック、ダッシュボード、または静的レポート

    注意事項も含めるよう依頼します。結合の品質が十分でない場合、サンプリングバイアスがある場合、モデルの仮定が成り立つか不確かな場合は、成果物にその旨を明記する必要があります。

    任意:Python 環境のセットアップ

    プロジェクトで再利用可能なスクリプトやノートブックが必要な場合は、既存の Python 環境を使用するか、最小限の再現可能な環境を新たにセットアップするよう ChatGPT に依頼します。ソースファイルは変更せず、分析、グラフ、最終レポートを別々に保存します。ChatGPT Work で添付ファイルを分析する前に Python をセットアップする必要はありません。

    おすすめのプロンプト

    データセットの読み込みと内容の説明

    添付したデータファイルを確認し、それぞれの内容を説明してください。目的変数になりそうな列、日付、区画または所在地の識別子、ファイル形式、欠損している情報、明らかな品質上の問題を特定してください。まだ結論は出さないでください。

    データ結合前の確認

    これらのデータセットをどのように結合すべきか確認してください。候補キーをプロファイリングし、重複レコードと一致しないレコードを提示し、明らかな書式上の問題を正規化したうえで、最も安全な結合方法を説明してください。欠損値を推測で補ったり、ソースファイルを上書きしたりしないでください。

    解釈可能な初期モデルの構築

    高速道路に近いことが不動産価値の低さと関連しているかをモデル化してください。まずは解釈可能なベースラインから始め、データで裏付けられる範囲で住宅の広さ、築年数、地域を考慮し、効果、不確実性、限界を平易な言葉で説明してください。

    ステークホルダー向けの結果の取りまとめ

    この分析を、ステークホルダー向けの簡潔なレポートにまとめてください。最初に結論を示し、裏付けとして最も有用なグラフを含め、データと結合の検証内容を説明し、限界や不確実性を明確に示してください。ソースデータは変更せず、作成したファイル名を明記してください。

    Tech stack

    Need

    分析スタック

    Default options

    pandas と、 matplotlib または seaborn の組み合わせ

    Why it's needed

    インポート、プロファイリング、結合、クリーニング、最初のチャート作成に適した標準構成です。

    Need

    モデリング

    Default options

    statsmodels または scikit-learn

    Why it's needed

    より複雑な予測モデルに進む前に、解釈可能なベースラインから始めます。

    Need Default options Why it's needed
    分析スタック pandas と、 matplotlib または seaborn の組み合わせ インポート、プロファイリング、結合、クリーニング、最初のチャート作成に適した標準構成です。
    モデリング statsmodels または scikit-learn より複雑な予測モデルに進む前に、解釈可能なベースラインから始めます。

    関連するユースケース