Need
分析スタック
Default options
pandas と、 matplotlib または seaborn の組み合わせ
Why it's needed
インポート、プロファイリング、結合、クリーニング、最初のチャート作成に適した標準構成です。
.md to the page URL.
Codex use case
雑然としたデータを明確な分析と可視化に変えます。
ChatGPT Work を使ってデータをクリーニングし、ソースを結合して問いを掘り下げ、結果をモデル化したうえで、補足チャートと注意事項を含む明確なレポートを作成します。
雑然としたデータを明確な分析と可視化に変えます。
ChatGPT Work を使ってデータをクリーニングし、ソースを結合して問いを掘り下げ、結果をモデル化したうえで、補足チャートと注意事項を含む明確なレポートを作成します。
| Skill | Why use it |
|---|---|
| Spreadsheets | CSV、TSV、Excel ファイルを調べ、数式と結合を確認し、レビュー可能な表やチャートを作成します。 |
| Google Drive | Drive 内で指定した、承認済みの Google スプレッドシートとソースファイルを読み取ります。 |
| Data Analytics | ソースの背景情報を収集し、データを分析・検証して、再利用可能なレポート、ダッシュボード、チャート、ノートブックを作成します。 |
データ分析の本質は、データを意思決定に役立てることです。分析自体が目的ではありません。目指すのは、行動につながる成果物を作ることです。たとえば、経営層向けのチャート、プロダクトチーム向けの実験結果のまとめ、研究者向けのモデル評価、日々の業務判断に役立つダッシュボードなどです。
書籍 R for Data Science で広く知られるようになった有用な枠組みは、ループです。データをインポートして整えた後、変換、可視化、モデリングを繰り返して理解を深め、最後に結果を伝えます。
ChatGPT Work は、このワークフローとの相性に優れています。データのクリーニング、仮説の検討、分析の実行、再現可能な成果物の作成を支援します。目指すのは、使い切りのノートブックではなく、他の人がレビューし、信頼し、再実行できる分析です。
データを使って答えたい具体的な問いを 1 つ選びます。問いが具体的であるほど、適切な入力データ、確認項目、成果を特定しやすくなります。
例として、次の問いを検討します:
高速道路に近い住宅は、不動産評価額がどの程度低いのでしょうか?
一方のデータセットに不動産評価額や売却価格が含まれ、もう一方に所在地、区画、高速道路への近接度に関する情報が含まれているとします。作業はモデルを実行するだけではありません。入力データの信頼性を確保し、結合の過程を文書化し、結果の堅牢性を検証して、最後に他の人が利用できる成果物にまとめます。
CSV や Excel ワークブックを添付したり、承認済みの Google スプレッドシートを @google-drive で指定したりできます。また、データがコンピューターに保存されている場合は、デスクトップアプリを使用できます。
架空のサンプルでは、ChatGPT は 11 件の不動産売却記録を高速道路までの距離データファイルと照合し、対応する距離データがない 1 件の売却記録にフラグを付けます。高速道路から 1 マイル以内の住宅の平均価格は $500,000 で、2~5 マイル離れた住宅の $600,000 と比べて低くなっています。
高速道路から遠い住宅のうち最も高額な物件を除外しても、差は $94,000 残ります。レポートとチャートでは、サンプルが少ないこと、照合できなかった売却記録を除外したこと、さらにこの比較から因果関係は立証できず、地域、売却時期、交通量、騒音の影響も調整していないことを説明しています。
まずファイルを添付し、ChatGPT に内容を調べるよう依頼します。これは、基本的ですが重要な次の点を確認するのに役立ちます:
この段階ではまだ結論を求めず、まず内容の一覧と説明を求めます。
実際の作業の多くはここから始まります。データセットが 2 つ以上あり、主キーが明確でない場合、安易に結合するとデータが失われたり、重複が生じたりする可能性があります。
結合を実行する前に、その処理をプロファイリングするよう ChatGPT に依頼します:
正規化した住所、複数の列を組み合わせた区画識別子、位置情報による結合などから最適なキーを導出する必要がある場合は、結合結果を採用する前に、トレードオフとエッジケースを説明するよう ChatGPT に依頼します。
モデルを選ぶ前に、チャートを使ってデータを理解します。この例では、高速道路に近い住宅と遠い住宅を比較し、外れ値と欠損値のパターンを調べ、見かけ上の効果が地域の構成、住宅の広さ、その他の要因を反映したものではないかを確認します。
各チャートを元の問いに結び付けます。他の人が分析を確認できるよう、有用な比較結果を保存します。
すべての分析に複雑なモデルが必要なわけではありません。まずは解釈可能なベースラインから始めます。
高速道路に関する問いでは、まず、住宅の広さ、築年数、所在地などの関連要因を調整しながら、高速道路への近さと不動産価値の関係を推定する回帰モデルなど、透明性の高いモデルを試すのが妥当です。
ChatGPT に次の点を明示するよう依頼します:
最初のモデルの性能が低くても、それは有用な情報です。問題の原因がモデル、特徴量、結合の品質、問い自体のどれにあるかを判断する材料になります。
分析は、ほかの人が活用できてこそ意味があります。受け手が必要とする成果物を作成するよう ChatGPT に依頼します:
注意事項も含めるよう依頼します。結合の品質が十分でない場合、サンプリングバイアスがある場合、モデルの仮定が成り立つか不確かな場合は、成果物にその旨を明記する必要があります。
プロジェクトで再利用可能なスクリプトやノートブックが必要な場合は、既存の Python 環境を使用するか、最小限の再現可能な環境を新たにセットアップするよう ChatGPT に依頼します。ソースファイルは変更せず、分析、グラフ、最終レポートを別々に保存します。ChatGPT Work で添付ファイルを分析する前に Python をセットアップする必要はありません。
データセットの読み込みと内容の説明
データ結合前の確認
解釈可能な初期モデルの構築
ステークホルダー向けの結果の取りまとめ
Need
Default options
Why it's needed
Need
分析スタック
Default options
pandas と、 matplotlib または seaborn の組み合わせ
Why it's needed
インポート、プロファイリング、結合、クリーニング、最初のチャート作成に適した標準構成です。
Need
モデリング
Default options
Why it's needed
より複雑な予測モデルに進む前に、解釈可能なベースラインから始めます。
| Need | Default options | Why it's needed |
|---|---|---|
| 分析スタック | pandas と、 matplotlib または seaborn の組み合わせ | インポート、プロファイリング、結合、クリーニング、最初のチャート作成に適した標準構成です。 |
| モデリング | statsmodels または scikit-learn | より複雑な予測モデルに進む前に、解釈可能なベースラインから始めます。 |