Need
분석 스택
Default options
pandas 와 matplotlib 또는 seaborn
Why it's needed
데이터 가져오기, 프로파일링, 조인, 정리, 1차 차트 작성에 적합한 기본 선택지입니다.
.md to the page URL.
Codex use case
정리되지 않은 데이터를 명확한 분석 결과와 시각화로 바꾸세요.
ChatGPT Work로 데이터를 정리하고 여러 소스를 조인하여 질문을 탐색하고 결과를 모델링한 뒤, 근거 차트와 한계를 담은 명확한 보고서를 만드세요.
정리되지 않은 데이터를 명확한 분석 결과와 시각화로 바꾸세요.
ChatGPT Work로 데이터를 정리하고 여러 소스를 조인하여 질문을 탐색하고 결과를 모델링한 뒤, 근거 차트와 한계를 담은 명확한 보고서를 만드세요.
| Skill | Why use it |
|---|---|
| Spreadsheets | CSV, TSV, Excel 파일을 검사하고 수식과 조인을 확인한 뒤 검토 가능한 표나 차트를 만드세요. |
| Google Drive | Drive에서 사용자가 지정한 승인된 Google Sheets와 원본 파일을 읽습니다. |
| Data Analytics | 소스 컨텍스트를 수집하고 데이터를 분석·검증하여 재사용 가능한 보고서, 대시보드, 차트 또는 노트북을 만드세요. |
데이터 분석의 본질은 데이터를 활용해 의사결정을 내리는 데 있습니다. 분석 자체가 목적은 아닙니다. 경영진을 위한 차트, 제품 팀을 위한 실험 결과 요약, 연구자를 위한 모델 평가, 일상적인 운영 방향을 제시하는 대시보드처럼 누군가의 행동을 돕는 결과물을 만드는 것이 목표입니다.
R for Data Science를 통해 널리 알려진 유용한 프레임워크는 반복 루프입니다. 데이터를 가져와 정돈한 다음 변환, 시각화, 모델링을 반복하며 이해를 쌓은 후 결과를 전달합니다.
ChatGPT Work는 이 워크플로우에 잘 맞습니다. 데이터를 정리하고, 가설을 탐색하고, 분석을 수행하며, 재현 가능한 결과물을 만드는 데 도움이 됩니다. 목표는 한 번 쓰고 마는 노트북이 아니라 다른 사람이 검토하고 신뢰하며 다시 실행할 수 있는 분석입니다.
데이터로 답하고 싶은 구체적인 질문 하나를 정하세요. 질문이 구체적일수록 적절한 입력 데이터, 점검 항목, 결과를 더 쉽게 파악할 수 있습니다.
예를 들어 다음 질문을 살펴보겠습니다:
고속도로 인근 주택의 부동산 가치는 어느 정도 더 낮을까요?
한 데이터세트에는 부동산 가치나 매매 가격이 있고, 다른 데이터세트에는 위치, 필지 또는 고속도로 근접성 정보가 있다고 가정해 보겠습니다. 단순히 모델을 실행하는 것만으로는 충분하지 않습니다. 입력 데이터를 신뢰할 수 있게 만들고, 조인 과정을 문서화하고, 결과를 면밀히 검증한 뒤, 다른 사람이 사용할 수 있는 결과물을 만들어야 합니다.
CSV 파일이나 Excel 통합 문서를 첨부하거나, @google-drive를 사용해 승인된 Google Sheet를 지정할 수 있습니다. 데이터가 컴퓨터에 저장되어 있다면 데스크톱 앱을 사용할 수도 있습니다.
가상의 표본에서 ChatGPT는 부동산 매매 11건을 고속도로까지의 거리 데이터 파일과 매칭하고, 일치하는 거리 정보가 없는 매매 1건을 표시합니다. 고속도로에서 1마일 이내에 있는 주택의 평균 가격은 $500,000입니다. 2~5마일 떨어진 주택의 평균 가격은 $600,000입니다.
고속도로에서 멀리 떨어진 주택 중 가격이 가장 높은 곳을 제외해도 차이는 여전히 $94,000입니다. 보고서와 차트는 표본이 작고 매칭되지 않은 매매 1건을 제외했으며, 이 비교만으로는 인과관계를 입증할 수 없고 동네, 매매 시점, 교통량, 소음의 영향을 통제하지 않았다고 설명합니다.
먼저 파일을 첨부하고 ChatGPT에 검사를 요청하세요. 그러면 다음과 같은 기초적이지만 중요한 질문에 답할 수 있습니다:
아직 결론을 요청하지 마세요. 먼저 데이터 구성과 설명을 요청하세요.
실제 작업은 대부분 여기서 시작됩니다. 데이터세트가 둘 이상이고 기본 키가 명확하지 않은 상황에서 무작정 병합하면 데이터가 유실되거나 중복이 생길 수 있습니다.
병합을 수행하기 전에 ChatGPT에 병합 프로파일링을 요청하세요:
정규화된 주소, 몇 개의 열을 조합해 만든 필지 식별자, 위치 기반 조인 등 최적의 키를 파생해야 한다면 병합을 확정하기 전에 ChatGPT에 장단점과 에지 케이스를 설명해 달라고 요청하세요.
모델을 선택하기 전에 차트로 데이터를 파악하세요. 이 예시에서는 고속도로 인근 주택과 더 멀리 떨어진 주택을 비교하고, 이상치를 살펴보고, 결측값 패턴을 조사하며, 관찰된 효과가 동네 구성, 주택 크기 또는 다른 요인을 반영한 것인지 확인합니다.
각 차트가 원래 질문과 직접 연결되도록 하세요. 다른 사람도 분석을 검토할 수 있도록 유용한 비교 결과를 저장하세요.
모든 분석에 복잡한 모델이 필요한 것은 아닙니다. 해석 가능한 베이스라인부터 시작하세요.
고속도로 관련 질문에는 주택 면적, 연식, 위치 등 관련 요인을 통제하면서 고속도로 인접도와 부동산 가치 사이의 관계를 추정하는 회귀 분석이나 그 밖의 해석 가능한 모델을 먼저 적용하는 것이 좋습니다.
ChatGPT에 다음 사항을 명확히 설명해 달라고 요청하세요:
첫 모델의 성능이 낮더라도 그 자체로 유용합니다. 문제가 모델, 특성, 조인 품질, 질문 자체 중 어디에 있는지 알 수 있기 때문입니다.
분석은 다른 사람이 활용할 수 있어야 의미가 있습니다. 대상 독자에게 필요한 결과물을 만들어 달라고 ChatGPT에 요청하세요:
유의 사항도 포함하도록 요청하세요. 조인 품질이 완벽하지 않거나 샘플링 편향이 존재하거나 모델 가정이 충분히 견고하지 않다면 결과물에 이를 명확히 밝혀야 합니다.
프로젝트에 재사용 가능한 스크립트나 노트북이 필요하다면 기존 Python 환경을 사용하거나 간단하고 재현 가능한 환경을 설정하도록 ChatGPT에 요청하세요. 원본 파일은 변경하지 말고 분석 결과, 차트, 최종 보고서를 각각 별도로 저장하세요. ChatGPT Work에서 첨부 파일을 분석할 때는 Python을 미리 설정할 필요가 없습니다.
데이터셋을 불러와 설명하기
데이터를 합치기 전에 병합 방식 점검하기
해석 가능한 첫 모델 만들기
이해관계자용 결과물로 정리하기
Need
Default options
Why it's needed
Need
분석 스택
Default options
pandas 와 matplotlib 또는 seaborn
Why it's needed
데이터 가져오기, 프로파일링, 조인, 정리, 1차 차트 작성에 적합한 기본 선택지입니다.
Need
모델링
Default options
Why it's needed
더 복잡한 예측 모델로 넘어가기 전에 해석 가능한 베이스라인부터 시작하세요.
| Need | Default options | Why it's needed |
|---|---|---|
| 분석 스택 | pandas 와 matplotlib 또는 seaborn | 데이터 가져오기, 프로파일링, 조인, 정리, 1차 차트 작성에 적합한 기본 선택지입니다. |
| 모델링 | statsmodels 또는 scikit-learn | 더 복잡한 예측 모델로 넘어가기 전에 해석 가능한 베이스라인부터 시작하세요. |
ChatGPT에 KPI 대시보드, 지표 정의, 내보낸 데이터, 세그먼트별 분석 자료, 출시 배경, 이해관계자 논의 스레드를 제공한 다음, 출처에 근거한 근본 원인...
Slack, 설문조사, 이슈 트래커, 고객 지원 또는 리서치 노트에서 수집한 피드백을 ChatGPT Work에 제공하세요
ChatGPT Work에 스프레드시트를 비공개 대화형 사이트로 만들고, 정해진 일정에 따라 소스 데이터를 확인하며, 주의가 필요한 변동을 표시하도록 요청하세요.