샤오미, 로봇 학습 성능 향상을 위한 데이터 양의 중요성 입증
샤오미가 로봇 학습에서 모델 크기보다 데이터의 양이 성능 향상에 더 큰 영향을 미친다는 사실을 확인했습니다. 10만 시간 이상의 데이터를 확보해 로봇 제어 모델의 효율성을 높였습니다.
주장샤오미는 로봇 학습 과정에서 모델의 크기를 키우는 것보다 더 많은 양의 데이터를 학습시키는 방식이 성능 향상에 효과적이라는 결론을 내렸습니다. 이는 로봇 인공지능 분야가 거대 언어 모델의 확장 법칙과는 다른 데이터 중심의 발전 경로를 따를 수 있음을 의미합니다.
팩트샤오미 연구진은 물리적 로봇 대신 카메라가 부착된 휴대용 그리퍼를 활용해 10만 시간 이상의 동작 데이터를 수집했습니다. 이 방식은 주방과 사무실, 공장 등 다양한 환경에서 로봇 없이도 데이터를 확보할 수 있게 하여 기존의 느리고 비용이 많이 드는 원격 조종 방식을 대체했습니다.
팩트수집된 방대한 데이터를 처리하기 위해 샤오미는 별도의 인공지능 모델을 도입해 각 동작을 텍스트로 자동 설명하도록 했습니다. 이 자동 라벨링 과정은 전체 데이터셋을 단 2주 만에 처리하여 작업 효율성을 극대화했습니다.
팩트데이터 학습 결과, 학습 데이터의 양을 늘림에 따라 낯선 환경에서의 로봇 작업 성공률이 기존 25%에서 75%까지 상승했습니다. 연구진은 데이터가 늘어날수록 성능이 계속 향상되고 있으며, 아직 데이터의 한계점에 도달하지 않았다고 밝혔습니다.
팩트샤오미가 개발한 모델인 샤오미 로보틱스-1은 4가지 새로운 작업 테스트에서 10시간 미만의 학습 데이터만으로 75%의 평균 성공률을 기록했습니다. 이는 경쟁 모델인 피지컬 인텔리전스의 40% 성공률보다 높은 수치이며, 특히 유연한 재질의 물체를 다루는 데 강점을 보였습니다.
주장로봇 인공지능의 발전은 단순히 연산 능력을 높이는 것이 아니라, 얼마나 다양하고 방대한 데이터를 확보하느냐에 달려 있습니다. 샤오미의 이번 성과는 로봇이 복잡한 환경에서 스스로 작업을 수행할 수 있는 범용 모델로 나아가는 중요한 이정표가 됩니다.
팩트샤오미는 이번에 개발한 모델과 코드를 깃허브와 허깅페이스를 통해 오픈 소스로 공개할 계획입니다. 이는 앞서 공개된 샤오미 로보틱스-0과 마찬가지로 실시간 로봇 제어 기술의 생태계를 확장하려는 전략으로 풀이됩니다.
교차검증로봇 인공지능 분야에서는 데이터 수집 방식에 대해 다양한 접근이 존재합니다. 엔비디아와 유시 버클리는 합성 데이터를 생성하여 문제를 해결하려 하며, 중국의 베이징 인공지능 연구소는 라벨링 없이 영상만으로 학습하는 모델을 연구하고 있습니다.
교차검증일각에서는 모델이 새로운 환경에 적응하는 것이 아니라 단순히 학습 데이터를 기억해내는 것이 아니냐는 의문을 제기하기도 합니다. 샤오미의 데이터 중심 접근 방식이 이러한 일반화 문제를 완전히 해결했는지에 대해서는 추가적인 검증이 필요합니다.
주장데이터의 양을 통해 로봇의 범용성을 확보하려는 샤오미의 시도는 향후 로봇 공학계의 데이터 수집 표준을 재정립할 가능성이 있습니다. 모델의 규모 경쟁에서 벗어나 데이터의 질과 양을 확보하는 것이 로봇 지능화의 핵심 과제로 떠오르고 있습니다.
주장이번 연구는 로봇이 현실 세계의 복잡한 물리적 제약을 극복하는 데 있어 데이터가 가진 잠재력을 증명했습니다. 향후 더 많은 기업이 데이터 확보를 위한 효율적인 수집 도구 개발에 집중할 것으로 전망됩니다.
출처더 디코더(The Decoder)의 보도 내용을 교차 검증했습니다.
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

