대기오염 측정소 PM2.5와 기온·습도·풍속 자료를 결합하면 다음 시간대 미세먼지를 예측할 수 있는가?
활용 가능한 공공데이터
AirKorea 대기오염 자료, 기상청 기상 관측 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
결측치 보정, 시차 변수 생성, 랜덤포레스트 회귀, 변수 중요도 분석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
예측 그래프, MAE/RMSE, 변수 중요도, 고농도 예보 기준 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_01.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='대기질·기상 기반 미세먼지 예측 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
02. 생활기상지수 기반 야외활동 위험도
성취기준: 데이터·알고리즘·인공지능분야: 기상·건강난이도: 중급
연구 질문
자외선·체감온도·대기정체지수로 학교 야외활동 위험 등급을 만들 수 있는가?
활용 가능한 공공데이터
기상청 생활기상지수, 기온·습도·풍속 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
가중치 기반 지수 설계, 등급 분류, 실제 사례 검증
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
야외활동 안전 지수표, 등급별 안내 문구, 시각화 대시보드
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_02.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='생활기상지수 기반 야외활동 위험도 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
03. 교통사고 다발 지역 위험도 지도
성취기준: 데이터·알고리즘·인공지능분야: 교통·안전난이도: 심화
연구 질문
학교 주변과 지역 주요 도로의 사고 위험은 어떤 공간적 패턴을 보이는가?
활용 가능한 공공데이터
교통사고 다발지역, 어린이보호구역, 도로명주소 좌표 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
위경도 지도 시각화, 사고 건수 정규화, 위험도 점수화
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
Folium 위험지도, 개선 우선순위, 보행 안전 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_03.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='교통사고 다발 지역 위험도 지도 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
04. 버스 도착 정보와 지연 패턴 분석
성취기준: 데이터·알고리즘·인공지능분야: 교통·시계열난이도: 중급
연구 질문
시간대·요일·날씨에 따라 버스 지연 시간이 어떻게 달라지는가?
활용 가능한 공공데이터
버스 도착 정보 API, 정류소 정보, 기상 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
도착 예정·실제 도착 차이 계산, 시간대별 그룹 분석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
지연 시간 히트맵, 혼잡 시간대 분석, 등하교 경로 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_04.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='버스 도착 정보와 지연 패턴 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
05. 인구소멸 위험과 생활 인프라 분석
성취기준: 데이터·알고리즘·인공지능분야: 인구·사회난이도: 중급
연구 질문
청년 인구 비율과 병원·학교·문화시설 접근성은 지역 소멸 위험과 어떤 관련이 있는가?
활용 가능한 공공데이터
주민등록 인구, 행정구역 경계, 공공시설 위치 데이터
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
고령화율·청년비율 계산, 시설 수 정규화, 상관분석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
지역별 소멸 위험 지도, 인프라 격차 분석
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_05.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='인구소멸 위험과 생활 인프라 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
06. 지역별 고령화와 의료 접근성
성취기준: 데이터·알고리즘·인공지능분야: 보건·공간분석난이도: 중급
연구 질문
고령 인구가 많은 지역일수록 의료기관 접근성이 충분한가?
활용 가능한 공공데이터
연령별 인구, 병원·약국 위치, 응급의료기관 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
행정구역별 의료기관 밀도, 고령인구 대비 의료 접근성 지표
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
의료 취약 지역 표, 지도, 정책 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_06.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='지역별 고령화와 의료 접근성 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
07. 전력 사용량과 기온의 상관 분석
성취기준: 데이터·알고리즘·인공지능분야: 에너지·기후난이도: 중급
연구 질문
기온 변화가 학교 또는 지역 전력 사용량에 어떤 영향을 주는가?
활용 가능한 공공데이터
전력 사용량 통계, 기상 관측 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
월별·일별 병합, 산점도, 선형회귀, 냉난방 민감도 추정
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
기온-전력 회귀식, 에너지 절약 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_07.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='전력 사용량과 기온의 상관 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
08. 태양광 발전량 예측
성취기준: 데이터·알고리즘·인공지능분야: 에너지·AI난이도: 심화
연구 질문
일사량·운량·기온으로 태양광 발전량을 예측할 수 있는가?
활용 가능한 공공데이터
신재생에너지 발전량, 기상청 일사량·운량 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
회귀 모델 비교, 예측 오차 분석, 계절성 반영
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
발전량 예측 모델, 계절별 성능 비교
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_08.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='태양광 발전량 예측 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
09. 수질 측정 데이터 이상 탐지
성취기준: 데이터·알고리즘·인공지능분야: 환경·이상탐지난이도: 심화
연구 질문
하천 수질 측정값에서 비정상 오염 징후를 자동으로 탐지할 수 있는가?
활용 가능한 공공데이터
수질 측정망 자료, 강수량 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
pH·DO·BOD 변수 분석, IQR 또는 Isolation Forest 이상 탐지
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
이상치 목록, 원인 추정, 수질 변화 그래프
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_09.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='수질 측정 데이터 이상 탐지 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
10. 감염병 발생 추세 시각화
성취기준: 데이터·알고리즘·인공지능분야: 보건·데이터시각화난이도: 중급
연구 질문
감염병 발생은 계절·지역·인구 밀도와 어떤 관계를 가지는가?
활용 가능한 공공데이터
감염병 통계, 지역별 인구, 기상 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
발생률 계산, 이동평균, 지역별 비교 시각화
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
발생 추세 그래프, 지역별 발생률 지도
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_10.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='감염병 발생 추세 시각화 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
11. 학교 주변 보행 안전 지수
성취기준: 데이터·알고리즘·인공지능분야: 안전·융합난이도: 중급
연구 질문
횡단보도·신호등·사고 이력·속도 제한 정보를 종합해 보행 안전 지수를 만들 수 있는가?
활용 가능한 공공데이터
교통안전시설, 사고 이력, 어린이보호구역, 도로 정보
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
시설 점수화, 사고 가중치, 위험 등급 분류
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
학교 주변 안전지도, 개선 지점 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_11.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='학교 주변 보행 안전 지수 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
12. 도서관·문화시설 접근성 분석
성취기준: 데이터·알고리즘·인공지능분야: 문화·공간분석난이도: 초중급
연구 질문
지역별 공공도서관과 문화시설 접근성은 인구 규모와 균형을 이루는가?
활용 가능한 공공데이터
공공도서관·문화시설 위치, 인구 통계
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
인구 1만 명당 시설 수, 거리 기반 접근성 비교
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
접근성 순위표, 지역 격차 해석
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_12.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='도서관·문화시설 접근성 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
13. 공공자전거 이용량 예측
성취기준: 데이터·알고리즘·인공지능분야: 교통·AI난이도: 심화
연구 질문
날씨와 시간대 자료로 공공자전거 대여량을 예측할 수 있는가?
활용 가능한 공공데이터
공공자전거 대여 이력, 정류소 정보, 기상 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
회귀 모델, 범주형 변수 인코딩, 특성 중요도 분석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
대여량 예측 모델, 피크 시간 분석
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_13.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='공공자전거 이용량 예측 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
14. 주차장 혼잡도 예측
성취기준: 데이터·알고리즘·인공지능분야: 도시·시계열난이도: 중급
연구 질문
공영주차장 입출차 데이터로 혼잡 시간대를 예측할 수 있는가?
활용 가능한 공공데이터
공영주차장 정보, 실시간 주차 가능 대수, 행사 일정
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
시간대별 점유율 계산, 이상 혼잡일 탐색
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
혼잡도 그래프, 방문 시간 추천
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_14.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='주차장 혼잡도 예측 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
15. 생활폐기물 배출량 예측
성취기준: 데이터·알고리즘·인공지능분야: 환경·지속가능성난이도: 중급
연구 질문
요일·계절·인구 자료로 생활폐기물 배출량을 예측하고 감축 방안을 제안할 수 있는가?
활용 가능한 공공데이터
생활폐기물 배출량, 인구, 기온 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
1인당 배출량 계산, 회귀분석, 계절성 분석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
배출량 예측표, 감축 캠페인 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_15.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='생활폐기물 배출량 예측 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
16. 재난 문자 데이터 분류
성취기준: 데이터·알고리즘·인공지능분야: 자연어처리·안전난이도: 심화
연구 질문
재난 문자 내용을 유형별로 자동 분류해 위험 정보를 빠르게 요약할 수 있는가?
활용 가능한 공공데이터
재난문자 공개 데이터, 지역·시간 정보
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
키워드 전처리, TF-IDF, 나이브베이즈 또는 로지스틱 회귀
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
재난 유형 분류기, 오분류 사례 분석
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_16.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='재난 문자 데이터 분류 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
17. 지역별 물가 변동 분석
성취기준: 데이터·알고리즘·인공지능분야: 경제·데이터난이도: 중급
연구 질문
생활필수품 가격은 지역·유통업태·시기에 따라 어떻게 변하는가?
활용 가능한 공공데이터
생필품 가격 정보, 소비자물가 통계
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
품목별 평균가격, 지역별 편차, 가격 변동률 계산
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
가격 변동 그래프, 합리적 소비 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_17.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='지역별 물가 변동 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
18. 교육 통계 기반 진학·과목 수요 분석
성취기준: 데이터·알고리즘·인공지능분야: 교육·데이터난이도: 중급
연구 질문
지역·학교 유형에 따른 과목 선택 또는 진학 경향은 어떤 차이를 보이는가?
활용 가능한 공공데이터
교육통계, 학교알리미 공개 자료, 진학 현황
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
그룹별 비율 비교, 추세 분석, 상관분석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
과목 수요 예측, 교육과정 운영 제안
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_18.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='교육 통계 기반 진학·과목 수요 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
19. 관광·유동인구 데이터 군집 분석
성취기준: 데이터·알고리즘·인공지능분야: 도시·군집화난이도: 심화
연구 질문
관광지별 방문 패턴을 군집화하면 어떤 유형으로 나눌 수 있는가?
활용 가능한 공공데이터
관광지 방문객, 유동인구, 날씨·행사 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
KMeans 군집화, 표준화, 군집별 특징 해석
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
관광지 유형 분류, 활성화 전략
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_19.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='관광·유동인구 데이터 군집 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
20. 범죄 예방 환경 데이터 분석
성취기준: 데이터·알고리즘·인공지능분야: 안전·윤리난이도: 심화
연구 질문
CCTV·가로등·유동인구·신고 데이터를 바탕으로 안전 취약 구역을 탐색할 수 있는가?
활용 가능한 공공데이터
CCTV·가로등 위치, 112 신고 통계, 유동인구 자료
탐구 설계
공공데이터를 CSV 또는 API로 수집하고 변수명·단위·갱신 주기를 정리한다.
공간 격자화, 밀도 분석, 개인정보 비식별화 검토
결측치, 이상치, 편향 가능성을 검토하고 분석 결과를 표와 그래프로 제시한다.
예상 산출물
안전 취약 지도, 환경 개선 우선순위
소논문 목차 예시
Ⅰ. 연구 동기와 문제 정의
Ⅱ. 공공데이터 출처와 변수 설명
Ⅲ. 데이터 전처리 및 분석 알고리즘
Ⅳ. 분석 결과와 시각화
Ⅴ. 정보 윤리, 한계, 개선 방향
예시 코드
import pandas as pd
import matplotlib.pyplot as plt
# 예시 파일명은 수업용 샘플 CSV로 바꾸어 사용합니다.
df = pd.read_csv('public_data_topic_20.csv')
print(df.head())
print(df.info())
# 숫자형 열의 기초 통계와 결측치 확인
num = df.select_dtypes('number')
print(num.describe())
print(df.isnull().sum())
# 첫 번째 숫자형 열을 기준으로 간단 시각화
if len(num.columns) > 0:
col = num.columns[0]
df[col].plot(kind='hist', bins=20, title='범죄 예방 환경 데이터 분석 - ' + col)
plt.xlabel(col)
plt.ylabel('빈도')
plt.show()
평가 요소
상
중
하
데이터 이해
데이터 출처·변수·단위·갱신 주기를 정확히 설명함
주요 변수는 설명하나 품질 검토가 일부 부족함
출처와 변수 의미 설명이 불충분함
분석 역량
전처리, 시각화, 알고리즘 선택 근거가 명확함
기본 분석은 수행하나 모델 비교나 해석이 제한적임
단순 출력 위주로 연구 질문과 연결이 약함
윤리·활용
개인정보·편향·오남용 가능성을 검토하고 공익적 활용 방안을 제시함
윤리 고려가 있으나 구체성이 부족함
데이터 활용 책임을 거의 다루지 않음
과학고 정보 수업용 공공데이터 활용 프로젝트 소논문 주제 20 | 데이터 수집·전처리·시각화·모델링·윤리 통합형 수행평가 자료