데이터팩토리
AI 학습에 필요한 데이터를 수집·가공·제공하는 플랫폼
정의와 배경
데이터팩토리란 AI 모델의 학습에 필요한 원시 데이터를 수집하고, 정제·가공·표준화·비식별화 과정을 거쳐 활용 가능한 형태로 제공하는 플랫폼을 의미한다. 공장(factory)이라는 명칭처럼, 원재료(raw data)를 투입하여 완제품(학습용 데이터셋)을 생산하는 일련의 파이프라인 구조를 갖추고 있다.
피지컬 AI 분야에서는 로봇이 물리 환경을 인식하고 작동하기 위해 이미지, 영상, LiDAR 포인트 클라우드, 로봇 동작 궤적 등 복잡한 다중 모달 데이터가 요구된다. 이러한 데이터를 안정적으로 공급하는 데이터팩토리의 존재가 AI 모델 개발의 전제 조건으로 부상하였다.
주요 기능과 구성 요소
데이터팩토리는 크게 수집, 가공, 관리, 제공의 네 단계로 구성된다. 수집 단계에서는 현장 센서, 시뮬레이션 환경, 공공 데이터, 크라우드소싱 등 다양한 경로로 원시 데이터를 확보하며, 가공 단계에서는 레이블링(labeling), 어노테이션(annotation), 증강(augmentation) 등의 처리가 이루어진다.
관리 단계에서는 데이터 거버넌스 체계를 통해 품질 기준 준수 여부를 점검하고, 개인정보 보호를 위한 비식별화 처리를 수행한다. 제공 단계에서는 데이터 라이브러리 형태로 표준화된 포맷의 데이터셋을 수요 기관이나 기업에 공급하며, 이때 데이터 표준화는 다양한 출처의 데이터를 통합·활용할 수 있도록 하는 핵심 요소이다.
피지컬 AI 메가프로젝트에서의 위상
피지컬 AI 메가프로젝트에서 데이터팩토리는 휴머노이드 로봇, AI 에이전트, 제조AI 파운데이션 모델 등 핵심 기술 전반의 공통 기반 인프라로 자리매김한다. 월드모델이 물리 환경을 시뮬레이션하고 풀스택 AI팩토리가 자율 운영을 실현하기 위해서는, 대규모의 고품질 실세계 데이터가 지속적으로 공급되어야 하며 이를 담당하는 것이 데이터팩토리이다.
정부와 산업계는 데이터팩토리를 단순한 저장소가 아닌, AI 생태계 전반의 경쟁력을 결정짓는 전략적 인프라로 인식하고 있다. 데이터의 양과 질이 AI 모델 성능을 직접 좌우하는 만큼, 데이터팩토리의 구축·운영 역량은 국가 차원의 피지컬 AI 경쟁력과 직결된다.