훈련 데이터로 학습한 모델을 테스트 데이터에 적용하여 예측한 결과를 제출하시오.
제공된 학습용 데이터(train.csv)는 유방암 종양의 다양한 특성(반지름, 둘레, 면적, 질감 등)에 대한 정량적 지표와 악성/양성 여부(target)를 포함하고 있습니다. 학습용 데이터를 활용하여 종양이 악성일 확률(target=1)을 예측하는 이진 분류 확률 예측 모델을 개발하고, 가장 우수한 모델을 평가용 데이터(test.csv)에 적용하여 예측 결과를 제출하시오.
- 모델 성능 지표: AUC (Area Under the Curve)
데이터 설명
종양의 특징을 나타내는 크기, 질감 등을 나타내는 데이터입니다.
- ID: 고유 식별자
- mean_radius: 반지름 평균
- mean_texture: 질감 평균
- mean_perimeter: 둘레 평균
- mean_area: 면적 평균
- mean_smoothness: 매끄러움 평균
- mean_compactness: 조밀도 평균
- mean_concavity: 오목함 평균
- mean_concave_points: 오목한 점 평균
- mean_symmetry: 대칭성 평균
- mean_fractal_dimension: 프랙탈 차원 평균
- radius_error: 반지름 오차
- … (기타 유사한 통계 지표들 포함)
- target: 악성 종양 여부 (0: 양성, 1: 악성)
※ level_0, ID 칼럼은 인덱스 초기화로 생긴 값으로 분석에 사용하지 않음
제출 형식
- 파일명: result.csv (디렉토리/폴더명 제외)
- 제출 칼럼: pred (총 1개 칼럼)
- pred: 예측된 악성 확률 (0 이상 1 이하의 실수)
- 행 수: 테스트 데이터(test.csv)의 ID 수와 동일
데이터 출처
|
‘https://raw.githubusercontent.com/YoungjinBD/data/main/exam/5_2_train.csv’
|
|
‘https://raw.githubusercontent.com/YoungjinBD/data/main/exam/5_2_test.csv’
|