➖ 그리고 Axis가 차세대 데이터 엔진을 어떻게 구축하고 있는가
정적인 데이터셋만으로는 더 이상 피지컬 AI에 충분하지 않습니다
그동안 로보틱스 업계는 데이터 규모를 가장 큰 병목으로 여겨왔습니다. 물론 여전히 중요한 문제입니다. 하지만 데이터 파이프라인의 확장이 쉬워질수록, 더 큰 한계도 분명해지고 있습니다. 정적인 데이터셋은 주로 이미 성공한 사례를 담을 뿐, 모델이 실제로 어디에서 무너지는지는 잘 보여주지 못합니다.
특히 긴 수평 작업과 접촉이 많은 조작에서는, 또 하나의 깔끔한 성공 트래젝토리보다 모델이 실패하는 바로 그 상태가 더 가치 있을 때가 많습니다. 불안정한 그립, 어긋난 정렬, 삽입 실패, 접촉 오류, 재시도가 필요한 순간이 바로 그런 경우입니다.
OmniReset [ICLR 2026] 같은 최근 연구도 이 점을 보여줍니다. 현재의 로보틱 강화학습은 긴 수평·고접촉 조작 태스크에서 여전히 취약하며, 학습이 좁은 상태 공간만 반복적으로 방문해 성능이 쉽게 포화될 수 있다는 것입니다.
Axis는 이 통찰을 바탕으로 실패 기반(failure-informed) 데이터 엔진을 구축하고 있습니다. 모델이 실패하면 그 상태를 보존하고, 이를 인간에게 다시 전달해 목표 지점형 텔레오퍼레이션으로 복구하게 하며, 그 복구 트래젝토리를 다음 모델 개선에 활용하는 방식입니다.
🥹 핵심 아이디어
🔘정적인 데이터셋은 과거의 시연을 담습니다.
🔘동적인 데이터 엔진은 모델이 아직 배워야 할 것을 담습니다.
🔘모델의 실패는 현재 데이터 분포에서 빠져 있는 커버리지의 정확한 좌표입니다.
🔘복구 트래젝토리는 매우 가치 높은 데이터입니다.
불안정한 접촉, 잘못된 정렬, 실패한 그립, 재시도 상태에서 어떻게 계속 이어가야 하는지를 모델에 가르쳐줍니다.
🔘인간 텔레오퍼레이션은 목표가 명확할수록 훨씬 더 가치 있어집니다.
기여자들은 모델이 실제로 무너지는 바로 그 지점에서 복구를 돕고 있는 것입니다
🔘정적 데이터에서 실패 기반 동적 데이터로
정적인 데이터셋은 이미 시연된 내용을 수동적으로 기록합니다. 반면, 동적인 데이터 엔진은 모델이 아직 실패하는 지점을 능동적으로 찾아내고, 그 정확한 순간을 새로운 학습 신호로 바꿉니다. 이 차이는 매우 중요합니다. 피지컬 AI 시스템은 단순히 이상적인 행동만 모방해서는 안 되기 때문입니다. 불확실한 상황 속에서도 작동하고, 완벽하지 않은 접촉에서 복구하고, 현실 세계가 완벽한 데모와 다르게 움직일 때도 계속 작업을 이어갈 수 있어야 합니다.
Axis에서는 모델의 실패를 가치 높은 데이터 자산으로 다룹니다. 우리는 다양한 초기 상태와 어려운 조건에서 정책을 평가할 때, 단순히 성공률이 낮아졌다는 결과만 기록하지 않습니다. 실패가 실제로 발생한 구체적인 상태를 그대로 보존합니다. 그 실패 좌표는 곧바로 인간 텔레오퍼레이션을 위한 목표 지점형 태스크로 플랫폼에 다시 전달됩니다.
그 결과로 만들어지는 데이터는 실패 기반 보정 트래젝토리(failure-informed correction trajectory) 입니다
즉, 모델의 현재 분포가 무너지는 정확한 지점에서 수집된 인간의 복구 행동 데이터입니다.
🔘모델은 단순히 학습만 하는 것이 아니라, 데이터를 진단해야 한다
트래젝토리가 많다고 해서 자동으로 더 좋은 로봇 지능이 생기는 것은 아닙니다. 데이터의 양은 그것이 학습 가능성, 커버리지, 강건성을 실제로 높여줄 때만 가치가 있습니다
그래서 Axis는 경량 정책 학습(lightweight policy training)을 일종의 진단 도구로 사용합니다
새로운 작업 데이터셋마다 수집된 궤적이 학습 가능한지 테스트하기 위해 경량 정책을 학습할 수 있습니다
🔘정책이 빠르게 수렴하고 다양한 초기 상태에서도 안정적으로 유지된다면, 그 데이터셋은 유용한 구조를 담고 있을 가능성이 높습니다.
🔘반대로 정책이 취약하거나, 특정 오브젝트 배치에서 실패하거나, 매우 제한적인 조건에서만 작동한다면, 그 실패들은 데이터 분포 안에 비어 있는 영역을 드러내는 신호가 됩니다.
이런 관점에서 보면, 모델은 단지 데이터 파이프라인의 결과물이 아닙니다. 오히려 데이터 파이프라인을 측정하는 도구이기도 합니다. 정책은 데이터셋이 무엇을 잘 가르치고 있는지, 무엇을 아직 충분히 담지 못했는지, 그리고 다음 데이터 수집이 어디서 시작되어야 하는지를 알려줍니다.
이것이 바로 동적 데이터 엔진의 핵심입니다.
데이터가 모델을 학습시키고, 모델은 실패를 드러내며, 실패는 새로운 데이터 태스크를 정의하고, 새로운 데이터는 다음 모델을 더 좋게 만듭니다
🔘실패는 시뮬레이션과 인간을 연결하는 인터페이스다
시뮬레이션은 정책을 반복적으로 평가하고, 상태를 정확하게 리셋하며, 대규모로 실패 모드를 발견할 수 있게 해주는 강력한 수단입니다. 인간 텔레오퍼레이션은 그에 못지않게 중요한 또 하나의 요소를 제공합니다. 바로 적응적인 복구 행동입니다.
시뮬레이션에서 정책이 실패하면, 그 상태는 그대로 보존되어 다시 인간 텔레오퍼레이션 태스크로 열릴 수 있습니다. 이때 인간 조작자는 처음부터 또 하나의 일반적인 성공 트래젝토리를 제공할 필요가 없습니다. 대신, 모델이 실패한 정확한 그 상태에서 시작해서 어떻게 복구해야 하는지를 시연합니다. 예를 들어 다시 잡기(regrasp), 다시 정렬하기(realign), 다시 끼워 넣기(reinsert), 밀기(push), 비틀기(twist), 재시도하기(retry), 혹은 좋지 않은 접촉 상태에서 계속 이어가기 같은 행동들입니다.
이렇게 되면 인간의 참여는 훨씬 더 목표 지점형이 되고, 훨씬 더 가치 있어집니다. 기여자들은 단순히 정적인 데이터 풀에 데이터를 추가하는 것이 아니라, 모델이 현재 처리하지 못하는 상황을 해결하는 데 직접 기여하게 됩니다.
OmniReset은 강건한 조작이 다양한 접촉 상태와 재시도 상황에 노출될 때 더 잘 형성된다는 점을 보여줍니다. Axis는 여기에 인간 보정 계층을 더합니다. 시뮬레이션이 실패 상태를 발견하고 재현하고, 인간이 그 복구 트래젝토리를 제공하며, 모델은 그 보정을 학습한 뒤 다시 다음 블라인드 스팟을 드러냅니다.
🔘Axis 플라이휠: 수집하고, 학습하고, 실패하고, 다시 수집하고, 개선한다
Axis의 데이터 엔진은 단순한 루프를 따릅니다.
수집 → 학습 → 실패 → 재수집 → 개선
먼저 유저들이 웹 기반 텔레오퍼레이션을 통해 트래젝토리를 기여합니다. 이 트래젝토리로 초기 정책을 학습시킵니다. 그런 다음 이 정책을 다양한 시뮬레이션 조건에서 평가합니다. 실패는 단순한 집계 지표로만 남지 않고, 구체적인 상태로 보존됩니다. 그 상태들은 다시 플랫폼에 목표 지점형 텔레오퍼레이션 태스크로 푸시됩니다. 인간은 그 지점에서 보정 트래젝토리를 제공합니다. 이 보정 데이터는 다시 학습으로 돌아가 정책을 개선하고, 또 그다음 실패 지점을 드러냅니다.
시간이 지날수록 데이터와 모델은 함께 진화합니다. 데이터셋은 더 이상 과거 시연의 기록 보관소가 아닙니다. 그것은 모델이 무엇을 배웠고, 어디서 여전히 실패하며, 인간이 그 실패를 어떻게 복구하도록 도왔는지를 보여주는 지속적으로 업데이트되는 지도가 됩니다.
이것이 바로 커뮤니티 참여가 중요한 이유이기도 합니다. 전통적인 데이터 파이프라인에서는 기여자들이 자신의 트래젝토리가 모델 행동에 어떤 영향을 주는지 거의 볼 수 없습니다. 그러나 동적인 데이터 엔진에서는 기여자들이 중간 단계의 모델과 상호작용하고, 실패 사례를 관찰하고, 로봇의 기술을 눈에 띄게 개선하는 보정 데이터를 직접 제공할 수 있습니다
전통적인 데이터 파이프라인은 이미 수집된 것을 최적화합니다
반면 동적인 데이터 엔진은 모델이 아직 배워야 하는 것을 최적화 합니다
이 차이는 특히 로보틱스에서 중요합니다
현실 세계의 조작은 부분적 성공, 불안정한 접촉, 교란, 재시도로 가득하기 때문입니다
Axis는 지금 이 다음 단계의 인프라를 구축하고 있습니다
인간은 적응적인 보정을 제공하고, 시뮬레이션은 대규모 평가와 정밀한 상태 리셋을 제공하며, 모델은 자신의 블라인드 스팟을 드러내는 방식으로 피드백을 제공합니다
그리고 커뮤니티는 이 지속적인 개선을 움직이는 핵심 동력이 됩니다
Axis X | Axis 한국 공지 채널 | Axis 한국 채팅방
» Axis Hub
