최대 10개의 초기 패킷 데이터를 이용하여 해당 패킷들로 구성된 플로우 데이터의 지속시간(duration)과 전송량(volume)을 예측합니다.
실제 플로우를 구성하는 패킷 길이가 10보다 큰 경우도 초기 10개만 제공됩니다.
예측 대상 값은 지속시간과 전송량을 각각 아래의 기준으로 구분한 클래스 값입니다.
Class | duration | volume |
0 | (0, 3000] | (0, 512] |
1 | (3000, 300000] | (512, 2048] |
2 | (300000, 6000000] | (2048, 32768] |
3 | (6000000, inf] | (32768, inf] |
데이터의 입출력은 다음과 같습니다.
입력: 특정 플로우의 초기 패킷 데이터 (최대 10개)
출력: 해당 플로우의 지속시간 및 전송량 각 1개
지속시간 클래스(duration_class) 전송량 클래스(volume_class)로 사전에 레이블됨
모델 입력 패킷 길이(input_packet_length)는 1~10 사이에서 자유롭게 활용 가능합니다.
예 input_packet_length =3일 때 해당 packet dataframe의 3번 인덱스까지만 사용
기존 연구에서는 주로 2 또는 3을 사용합니다.
상세한 형상은 아래 데이터 설명 부분을 참고합니다.
관련하여 주요 선행연구를 알려드리니 참고 바랍니다.
본 대회는 일반적인 대회와 달리 ‘추론 결과’가 아닌 ‘모델’을 제출하는 ‘추론자동화’ 방식으로 결과를 제출합니다.
테스트셋이 참가자분들께 제공되지 않으며, 평가는 보안 환경 내에서 제출된 모델에 평가데이터를 적용하여 자동으로 수행됩니다.
모델 제출 방식은 [베이스라인] 탭에 제공되는 모델 및 코드 내용(task.ipynb)을 참고합니다.
일 10회 제출이 가능하며, 이전 제출 결과가 나온 뒤 10분 후부터 재제출하실 수 있습니다.
🗂️task2_data.zip
├── 📈 train_packet_data_00000.pkl × 12 - 학습 데이터 입력 (1개 파일 당 50000개 샘플 × 12개)
├── 📈 train_flow_data.pkl - 학습 데이터 출력
└── 📈 t2_codebook.csv - 데이터 컬럼 설명
※ 평가 데이터는 미제공
※ 평가 데이터와 학습 데이터의 형상은 동일합니다.
입력데이터:

10 × 25 크기의 dataframe 50,000 개로 이루어진 pkl 파일 12개 (총 600,000개)
각 파일은 dataframe의 list로 이루어져 있음
전체 가운데 i번째 dataframe은 train_flow_data의 i번째 row 플로우에 해당되는 패킷값
패킷 길이가 10개 미만인 플로우의 빈 row는 nan 또는 0, False 등의 컬럼별 빈 값(기본값)을 가짐
컬럼 정보:
packet_capture_time: 해당 row의 패킷이 기록된 시간
flow_start_time: 해당 패킷을 포함하는 플로우의 시작 시간
*_ip: ip값을 5자리 숫자 string으로 비식별화 (고유값)
*_port: port값을 5자리 숫자 string으로 비식별화 (고유값)
기타 column 항목들의 의미는 t2_codebook.csv 참고
출력데이터 (train_flow_data.pkl):

600,000 × 11 크기의 dataframe으로 이루어진 pkl파일
i번째 row는 train_flow_data의 전체 가운데 i번째 dataframe에 해당되는 플로우값
레이블은 duration_class, volume_class 두 개를 사용
컬럼 정보:
packet_capture_time 등: 패킷 데이터와 동일
pkl_count: 해당 플로우의 실제 패킷 수
volume: 전송량(bytes)
flow_duration: 지속시간(microseconds)
duration_class: 지속시간 클래스
volume_class: 전송량 클래스
※ packet_data, flow_data 인덱스 매칭 구조

입력데이터:
학습 데이터와 동일한 구성의 100,000개 샘플로 구성
입력 파일경로: “/aif/data/test_packet_data.pkl”
출력데이터(레이블):
학습 데이터와 동일한 구성의 100,000개 샘플로 구성
duration_class, volume_class 두 개만 사용
본 태스크는 모델을 제출하여 자동 추론 방식으로 평가를 수행하므로, 추론용 모델 스크립트에서 결과를 파일로 저장하도록 구성합니다.
총 100,000 개 duration_class, volume_class 값을 ”submission.pkl”로 저장
pandas dataframe 형태 (※ numpy array나 tensor가 아님에 주의)

micro F1-score

traffic volume 예측 관련 논문
Q. He, A. Moayyedi, G. Dán, G. P. Koudouridis, and P. Tengkvist, “A Meta-Learning Scheme for Adaptive Short-Term Network Traffic Prediction,” Ieee J Sel Area Comm, vol. 38, no. 10, pp. 2271–2283, 2020, doi: 10.1109/jsac.2020.3000408.
I. Frommholz et al., “Unlocking the Potential of Deep Learning in Peak-Hour Series Forecasting,” Proc. 32nd ACM Int. Conf. Inf. Knowl. Manag., pp. 4415–4419, 2023, doi: 10.1145/3583780.3615159.
flow 식별 관련 논문
A. Majidi, N. Jahanbakhsh, X. Gao, J. Zheng, and G. Chen, “DC-ECN: A machine-learning based dynamic threshold control scheme for ECN marking in DCN,” Comput. Commun., vol. 150, pp. 334–345, 2020, doi: 10.1016/j.comcom.2019.10.028.