AI허브 데이터셋 고르는 기준 — 977개에서 받을 것과 거를 것을 가르는 2x2 지도

AI허브에서 뭘 받아야 할지 몰라서 목록만 스크롤하다 닫은 적 있으신가요?

다운로드 받는 방법을 알려주는 글은 많습니다. 그런데 977개 중에 무엇을 받을지 기준을 주는 글은 찾지 못했습니다. 그래서 데이터셋 977개의 다운로드 수와 용량을 하나하나 집계했고, 그 표에서 고르는 기준이 나왔습니다. 인기순 정렬로는 안 나오던 기준입니다.

이 글은 혼자 공부하거나 만들어 보는 분을 독자로 놓고, 두 가지 기준으로 977개를 네 가지 경우로 나눕니다. 하나는 용량(내 컴퓨터가 감당하는가), 다른 하나는 쓰는 방식(구조만 보면 되는가, 원본 전체가 필요한가).

AI허브 데이터셋 2×2 판정 지도 — 용량(1GB 이하/100GB 이상)과 쓰는 방식(구조만/원본 전체)으로 네 칸을 가른다
977개를 용량과 쓰는 방식으로 가른 지도.

결론부터 — 판정 기준 한 줄

받을 데이터는 인기로 고르는 게 아니라, 내 디스크 사정과 내 목적이 만나는 지점에서 고릅니다. 977개 중 오늘 받아도 되는 구간은 1GB 이하 125개이고, 나머지는 대부분 "읽을 대상"이지 "받을 대상"이 아닙니다.

인기순 정렬이 실패하는 이유

인기 상위권은 음성·영상 같은 대용량이 많습니다. 전체 977개의 용량 중앙값이 190GB이고 1TB를 넘는 것도 155개라서, 인기순 상단을 그대로 따라가면 첫 다운로드에서 디스크가 마릅니다. 인기 순위는 "기관과 연구팀이 많이 쓴다"를 알려줄 뿐, "내가 받아도 되는가"를 알려주지 않습니다.

오해 교정 — 다운로드가 적은 데이터가 나쁜 데이터라는 보장도 없습니다. 977개 중 633개가 1,000회 미만인데, 상당수는 품질 문제가 아니라 눈에 안 띄어서 묻혀 있습니다.
인기순 상단은 대용량이 몰려 있어 첫 다운로드에서 디스크가 마른다 — 용량부터 보면 1GB 이하 125개가 개인의 입구
인기 순위는 내 디스크 사정을 모른다.

무엇으로 나눴나 — 용량과 쓰는 방식

기준은 두 개면 충분합니다. 하나는 용량: 1GB 이하인가, 100GB를 넘는가. 다른 하나는 쓰는 방식: 파일 구조와 필드만 참고하면 되는가, 원본 데이터 전체를 학습에 넣어야 하는가. 이 둘은 서로 겹치지 않아서, 표로 그리면 네 가지 경우가 나옵니다.

2x2 지도 전체 보기

구조만 필요원본 전체 필요
1GB 이하✅ 오늘 받기✅ 두 번째 순서
100GB 이상📄 받지 말고 읽기⚠️ 팀·장비 갖춘 뒤

경우마다 할 일이 다릅니다. 아래에서 하나씩 봅니다.

가볍고 구조만 보면 될 때 — 오늘 받기

여기가 개인의 입구입니다. 감성 대화 말뭉치 같은 텍스트 데이터는 수십 MB라 몇 초에 내려오고, 메모장으로 열립니다. 필드 구성을 보고 챗봇 FAQ 틀이나 분류 규칙을 잡는 용도라면 여기서 끝납니다. 977개 중 125개가 여기 있습니다.

가볍지만 원본까지 필요할 때 — 두 번째 순서

소형 텍스트로 실제 분류기나 요약 모델을 학습시키는 경우입니다. 받는 부담은 앞의 경우와 같지만, 이용 조건이 무거워집니다. 원본은 AI 학습용으로만 쓰고 재배포하지 않는다는 조건, 해외 서버 반출은 별도 합의라는 조건이 여기부터 실질적으로 작동합니다.

받은 데이터를 챗봇에 올려서 분석시키는 것도 원본은 안 됩니다. 국외 반출에 별도 합의가 필요하다는 조항 때문에 해외 서버 AI에 원본을 올리는 건 정책 충돌입니다. 목록과 구조 정보만 올리고, 원본 가공은 내 컴퓨터에서 합니다.

무겁고 구조만 궁금할 때 — 받지 말고 읽기

수백 GB짜리 음성·영상 데이터의 설명 페이지는 그 자체로 훌륭한 설계 문서입니다. 어노테이션 체계, 수집 조건, 파일 구조가 다 공개돼 있어서, 받지 않고 페이지만 읽어도 내 데이터 설계에 가져다 쓸 수 있습니다. 여기서 다운로드 버튼을 누르는 순간 시간과 디스크를 잃습니다.

무겁고 원본까지 필요할 때 — 맨 나중

대형 음성인식이나 비전 모델을 실제로 학습시키는 경우인데, 이건 개인이 혼자 감당할 일이 아닙니다. 스토리지 수 TB와 GPU가 전제라서, 이럴 땐 부담이 됩니다. 팀이나 학교·회사 자원이 생겼을 때 여는 선택지로 남겨두면 됩니다.

내부 링크 — 이렇게 2x2로 가르는 방식은 AI 도구 4종을 언제 갈아타야 하는지 가른 지도에서 쓴 틀과 같습니다.

순서대로 세 번 묻기 — 용량, 형식, 내 분야

목록에서 데이터셋 하나를 봤을 때 순서대로 세 번만 묻습니다.

① 용량이 1GB 이하인가 → ② 형식이 텍스트(JSON·CSV)인가 → ③ 내 분야 문장이 들어 있는가.

셋 다 예면 오늘 받고, 하나라도 아니오면 즐겨찾기에만 담습니다. 판정에 다운로드 수는 안 들어갑니다. 남들의 사용량은 내 디스크 사정을 모르기 때문입니다.

10초 판정법 세 단계 — 1GB 이하인가, 텍스트인가, 내 분야 문장이 있는가
셋 다 예일 때만 오늘 받는다.

AI허브만 볼 일인가 — 세 곳 비교

같은 기준(가입 장벽, 한국어 자료가 얼마나 많은가)으로 재면 세 곳의 역할이 갈립니다.

AI허브허깅페이스공공데이터포털
가입 장벽가입+데이터별 신청대부분 즉시목록은 없음
한국어 밀도✅ 전체가 한국어권일부 (검색 필요)목록·통계 위주
맞는 용도한국어 원본 학습빠른 실험·비교후보 목록 훑기

제 운용은 이렇게 쪼개져 있습니다. 후보 훑기는 공공데이터포털의 목록 CSV로 하고, 실험은 허깅페이스에서 먼저 돌리고, 한국어 원본이 필요해진 시점에만 AI허브 신청을 넣습니다. 어느 한 곳이 이긴 게 아니라 순서가 다른 겁니다.

AI허브에도 한국어-외국어 번역 말뭉치 계열이 있지만, 순수 외국어 데이터가 목적이면 허깅페이스가 맞는 곳입니다.

내 목록에서 거른 것들

이 글의 추천 순서에서 제가 뺀 것도 적어둡니다. 하나, 공식 다운로드 셸 스크립트의 윈도우 사용 — 분할 파일 병합이 조용히 깨지는 걸 직접 겪어서, 윈도우 사용자에게는 약합니다. 둘, 클로드 데스크톱용 AI허브 연결 도구 — 자바 설치가 전제라 코딩 안 하는 분에게는 과합니다. 둘 다 존재 자체는 유용하니, 환경이 맞는 분은 쓰셔도 됩니다.

ETRI 쪽 공공 API 서비스는 종료됐습니다

검색하면 아직 나오는 정보 중에 폐기할 게 있습니다. 한국어 AI 기술을 API로 제공하던 ETRI 쪽 공공 서비스는 2025년 6월 30일자로 종료됐습니다. "공공 AI API를 쓰면 된다"는 글을 지금 따라 하면 막힙니다. 현재 살아 있는 경로는 데이터 다운로드 쪽입니다.

내부 링크 — 판정 기준을 세워서 고르는 글은 무료 TTS를 고르는 기준 편에서도 같은 방식으로 정리했습니다.

시작 조합 추천

처음이라면 이 순서를 권합니다. 공공데이터포털 목록 CSV로 후보 10개 추리기 → AI허브에서 1GB 이하 텍스트 1개 신청(자동승인, 3개월 유효) → 구조 보고 내 용도에 맞춰보기. 여기까지 비용은 0원이고, 필요한 건 이메일 계정 하나입니다.

개인 연구 목적은 제출 즉시 자동승인됩니다. 기다림은 없었고, 유효기간 3개월이 지나면 재신청하면 됩니다.

정리

977개는 목록으로 보면 미로지만, 기준 두 개를 대는 순간 네 가지 경우로 정리됩니다. 이 지도의 한계도 적어두면, 기준이 용량과 쓰는 방식뿐이라 라이선스 세부나 데이터가 얼마나 최신인지는 경우마다 다시 확인해야 합니다.

집계 과정 전체는 영상으로 기록해 뒀습니다.

댓글 남기기 → 목록으로