팀원분들의 원활한 대회 참여를 위하여, 안내 태스크에도 데이터와 베이스라인을 추가 게시하였습니다.
본 태스크에
버튼을 누르신 후 이용 부탁드리며, 본 대회는 예선 태스크가 아니기에 리더보드 제출은 되지 않는 점 참고 부탁드립니다.
───────────────────────────────────────────────────────────────
📁
├──📁 aT_train_raw: 학습셋 raw data
│ ├── domae_0~36: 도매 시장 데이터
│ ├──📃 somae_0~36 : 소매 시장 데이터
│ ├──📃 pummok_0~36 : 도매 경락 데이터
│ ├──📃 weather_0~36 : 주산지 날씨 데이터
│ └──📃 imexport_0~36 : 수입 수출 데이터
│
├──📁 aT_test_raw: 평가셋 raw data
│ └──📁 sep_0~9: 총 10개 구성의 평가셋 raw data로 각 폴더 내 항목은 * aT_train_raw와 같은 종류
│
├──📁 data: 묶음/전처리 완료된 데이터셋 (위 domae … imexport의 전 항목을 품목마다 하나의 테이블로 합산 정리)
│ ├──📁 train: 학습셋
│ │ └─ 📃 train_0~36.csv: 0~36번까지 대상 품목별로 raw data의 통합이 끝난 학습 데이터
│ └──📁 test: 평가셋
│ └─📁 set_0~9: 10개 테스트셋 개별 폴더
│ └─ 📃 test_0~36.csv: 각 set마다 대상 품목별로 raw data의 통합이 끝난 평가 입력 데이터
│
├──📃 answer_example.csv: 제출하실 정답의 양식 파일(※중요)
└──📃 preprocessing.py: 위 raw data에서 train, test 셋을 생성하는 코드 (참고용)
───────────────────────────────────────────────────────────────
학습 및 예측 대상은 전체 37개 품목입니다.
제공 데이터는 모든 품목에 대한 도매, 소매, 품목, 수입 수출, 날씨 데이터입니다.
학습 데이터는 ‘2013.01.01~2016.12.31'까지, 평가데이터는 각 10개 set별로 ‘2017.01.01` 이후 특정 2주간입니다.
데이터에서 값이 nan인 경우 거래가 발생하지 않은 날입니다.
예측하여 제출할 값은 pummock 데이터의 ‘해당일자_전체평균가격(원)'의 기준 시점 대비 변동률입니다.
(※ 가격이 아니라 변동률임에 유의)
위에 설명한 것과 같이 제출해야 할 답은 가격이 아니라 변동률입니다.
변동률을 예측하는 모델을 만들어도 되고, 가격을 예측한 다음 변동률로 자동 변환하는 모델을 만들어도 됩니다.
변동률은 기준시점(t) 대비 변동률입니다.
기준시점은 각 set별 품목별 입력데이터의 마지막 시장일자입니다.
변동률은 (대상시점의 값 - 기준시점의 값) / (기준시점의 값) 으로 계산합니다.
예측해야 할 변동률은 각 set, 품목별로
1) 입력 데이터 기간 이후 14일 동안 매일의, 기준시점 대비 변동률 14개값
2) 입력 데이터 기간 이후 22~28일(+4주차) 기간의 기준시점 대비 변동률의 평균 1개값
이상의 15개입니다.
학습 데이터에는 변동률 없이 가격만 제공이 됩니다. 이는 학습 데이터를 어떻게 분할, 사용하는지에 따라 변동률 계산에 필요한 기준시점이 달라지기 때문으로, 학습 시에는 각 참가자분들께서 원하는 형태로 데이터를 입출력 샘플로 분할한 다음 적절하게 기준시점을 설정, 변동률을 산출하여 학습에 이용 바랍니다.
※ 위 예시의 입력부는 제공되는 평가 데이터 입력에 한정하여 설명한 것입니다. 학습 데이터도 예측에 활용할 수 있기 때문에 그로부터 얻어진 계절적, 주기적 특성까지 포함하거나 하면 입력 형상은 달라질 수 있으므로 참고 바랍니다.
위 이미지는 데이터와 함께 제공되는 answer_example.csv의 형상입니다.
해당 양식에 각 set별, 품목별로 예측한 변동률 값을 채워서 제출하면 되겠습니다.
그림에 회색으로 표시된 것과 같이 값이 0이 아니라 nan으로 채워져 있는 일자는 실제로 거래가 발생하지 않은 날로,
해당 일자의 값은 평가에 반영되지 않습니다. 따라서 해당 부분의 값은 그대로 nan으로 비우고 제출하면 되겠습니다.
예를 들어 예측 대상 기간에 nan이 두 개인 경우…
- 14일치 변동률을 모두 예측한 다음 nan인 날을 빼고 각각의 위치에 채워넣거나
- 12일치 변동률을 nan인 날을 건너뛰면서 각각의 위치에 채워넣는 방식 모두 가능합니다.
이와 같은 부분은 참가자분께서 모델링을 어떻게 하는지에 따라 달라질 수 있는 부분으로 재량껏 결정하시면 되겠습니다.
만약 정답 양식에서 예측 대상구간 전체가 nan인 경우 해당 대상은 예측하지 않아도 됩니다.
t+22 ~ 28 (+4주차) 구간의 평균 변동률 또한 양식의 값이 nan인 경우 예측하지 않아도 됩니다.
baseline 모델은 마지막에 변동률을 산출하여 정답 양식에 채우도록 되어있습니다. 이를 참고하셔도 됩니다.
제공되는 answer_example.csv의 양식 그대로에, nan이 아닌 부분의 값을 채워서 제출하면 됩니다.
양식 파일에서 예측, 제출 대상인 항목, 구간에는 기본적으로 0이 채워져 있습니다.
utf-8 인코딩으로 저장하여 제출 바랍니다.