데이터셋에 대한 스펙은 다음과 같습니다.
인스턴스 수 : 768개
속성 수 : 8가지
결과 클래스 수 : 2가지
8가지 속성(1번~8번)과 결과(9번)의 상세 내용은 다음과 같습니다.
임신 횟수
경구 포도당 내성 검사에서 2시간 동안의 혈장 포도당 농도
이완기 혈압 (mm Hg)
삼두근 피부 두겹 두께 (mm)
2 시간 혈청 인슐린 (mu U/ml)
체질량 지수
당뇨 직계 가족력
나이 (세)
5년 이내 당뇨병이 발병 여부
데이터셋은 다음과 같이 구성합니다.
훈련셋 X: 1~700번째 행, 1번~8번 즉 8가지 속성
훈련셋 Y: 1~700번째 행, 9번
시험셋 X: 700~768번째 행, 1번~8번 즉 8가지 속성
시험셋 Y: 700~768번째 행, 9번
데이터셋은 크게 훈련셋과 시험셋으로 나눠져 있으며, 각 세트는 문제(x)와 정답(y) 파일로 구성되어 있습니다.
훈련셋
x_train.csv
훈련셋의 문제입니다. 총 700개의 샘플이 포함되어 있으며, 각 샘플은 8개의 속성이 담겨져 있습니다.
y_train.csv
훈련셋의 정답입니다. 총 700개의 샘플이 포함되어 있으며, 각 샘플은 1개의 결과값이 담겨져 있습니다.
시험셋
x_test.csv
훈련셋의 문제입니다. 총 68개의 샘플이 포함되어 있으며, 각 샘플은 8개의 속성이 담겨져 있습니다.
y_pred_sample.csv
시험셋의 정답지 샘플 파일로 총 68개의 수치가 기록되어 있으며, 각 수치의 값은 0으로 설정되어 있습니다. x_test.csv에 포함된 문항을 풀어 푼 답을 각 행에서 바꿔치기 하면 됩니다. 행하나 당 답 하나씩 기재합니다. 총 68문제이므로 68개의 행으로 작성합니다.