AI HUB에서 공개되어 있는 농산물 품종별 데이터 셋의 10개 종류 중 8 종류를 선택하였습니다.
각 종류별 이미지는 128*128 pixel로 resize 되었습니다.
json파일에서는 file_name, cate3, width, height, weight 정보만 추출하여 Train, Test .csv파일에 저장하였습니다.
전체 데이터는 github에 업로드된 데이터를 사용합니다.
google colab에서 !git clone https://github.com/yuri0329/AIFactory_FruitQC.git 명령어로 다운로드 받을 수 있습니다.
128*128*3 (RGB채널) 크기의 이미지 입니다.
8 종류의 이름은 다음과 같습니다.
apple_fuji
mandarine_hallabong
mandarine_onjumilgam
pear_chuhwng
pear_singo
persimmon_bansi
persimmon_booyu
persimmon_daebong
데이터 셋 구성에 대한 설명은 다음의 표와 같습니다.
한 종류당, 1000장씩(8종류)을 랜덤으로 뽑아 Train, Test, Valid Set을 각 800, 100, 100 장으로 나누었습니다.
Train Set은 총 6400장이고, Test Set과 Validation Set은 각각 800장 입니다.
| Training Set | Testing Set | Validation Set |
Image Data | 6400 | 800 | 800 |
‘file_name’, ‘cate3’, ‘width’, ‘height’, ‘weight’ 정보를 추출하여 data.csv파일로 저장하였습니다.
전체 46594개의 행, 4개의 열을 가지고 있습니다.
농작물의 정보가 담긴 데이터 파일
‘file_name’, ‘cate3’, ‘width’, ‘height’, ‘weight’ 속성이 담겨있습니다.
최종으로 제출할 Valid 폴더의 이미지들에 대한 정보가 담겨있습니다.
‘width’, ‘height’, ‘weight’ 속성이 담겨있습니다.
Valid.csv의 각 인덱스가 이미지파일의 이름이 됩니다. 예) 인덱스 1 → 1.png
총 800개의 열을 가지고 있습니다.
참가자는 농작물 이미지로 농작물의 종류를 분류하고, data.csv에 담긴 농작물의 정보로 농작물의 등급을 예측해야 합니다.
농작물의 등급을 예측하기 위해 농작물의 종류를 먼저 분류해야 합니다.
제출 형식은 각 이미지 별 하나의 값을 제출해야 하기 때문에, 하나의 열을 가진 csv파일로 제출해야 합니다.
제출 형식은 (농작물 라벨링인코딩 값 * 3) + 등급(보통:0, 상:1, 특:2)의 값을 저장하여 제출합니다.
예1) apple_fuji == 0, 특등급 == 2 → 0*3 + 2 = 2
예2) pear_singo == 4, 상등급==1 → 4*3 + 1 = 13
참가자는 위 형식대로 작성한 csv파일을 결과물로 제출해야 합니다.