GIST AI Lab

Robotics & Physical AIDaily Digest

2026-09-02 — 로봇 연구 중심, 핵심 AI 엄선 큐레이션
Robotics 50 Frontier AI 9 소스 18개 Robotics 최근 7일 · Frontier AI 최근 15일 Robotics-first 매일 09:00 KST 업데이트 중요도 정렬
분류·중요도·수집 기준
업데이트
매일 08:00 KST 전후 수집을 시작하고, 09:00 KST 전후 공개 페이지에 새 연구 소식을 반영하는 것을 목표로 합니다.
표시 범위
로보틱스 본문은 최근 7일, 별도 Frontier AI 레인은 검증된 공개일 기준 최근 15일 이내 항목만 표시합니다. 본문의 날짜 없는 항목은 Hugging Face, GitHub, Papers with Code처럼 일일 트렌딩 피드에서 온 경우에만 포함합니다.
편집 비중
로보틱스 본문은 최대 50건(핵심 로봇 약 38건, 직접 기여하는 AI 최대 12건), Frontier AI는 별도 최대 10건입니다. Radar는 LLM에 한정하지 않고 멀티모달·비전·공간 3D/4D·비디오/월드 모델·오디오·과학 모델의 중요한 공개를 다룹니다. 품질이 부족하면 억지로 채우지 않습니다.
중요도
★★★★★패러다임 전환, 주요 SOTA 갱신, 대형 오픈소스 모델 공개
★★★★의미 있는 기술 혁신, 주요 연구소 발표, 코드 공개 우수 논문
★★★유용한 개선, 도구, 데이터셋, 벤치마크, 실용 응용
★★니치하지만 해당 분야에서 참고할 만한 결과
관련성은 있지만 연구 임팩트가 제한적인 항목
연구 분야
🤖 VLA & Embodied Foundation Models
VLA/WAM, 로봇 파운데이션 모델, 체화 추론, cross-embodiment 정책
🖐 Manipulation & Dexterity
파지, 접촉·촉각 기반 정교 조작, 도구 사용, 양팔 협응
🎯 Robot Learning, Control & Planning
모방학습·강화학습, 정책 최적화, 작업/동작 계획, 제어, sim-to-real
🦿 Locomotion & Whole-Body Control
보행, 균형, 휴머노이드 전신 제어, loco-manipulation
🧭 Mobility, Navigation & Autonomy
이동 로봇·모바일 매니퓰레이션, 내비게이션, SLAM, 지상 자율주행
🚁 Aerial, Field, Marine & Multi-Robot
드론/UAV, 필드·해양 로봇, 군집, 다중 로봇 협업
📊 Data, Benchmarks, Simulation & Tools
로봇 데이터셋·데이터 엔진, 벤치마크, 시뮬레이터, 원격조작, 연구 도구
🛠 Hardware, Sensing, Deployment & Safety
로봇 하드웨어·센서, 실시간 시스템, 신뢰성, 안전, 인간-로봇 상호작용
🧠 Selected Robotics-Enabling AI
로봇 연구에 직접 기여하는 공간지능·효율 추론·학습 인프라
🔭 Frontier AI
언어 모델에 국한하지 않은 범용 파운데이션 모델의 주요 신규 공개
소스 원칙
arXiv·공식 프로젝트/코드/데이터·모델 카드를 원문으로 삼고, GitHub 기반 일일·큐레이션 피드는 새 항목을 발견하는 보조 신호로 사용합니다. 동일 연구와 동시 공개는 canonical ID와 release event 기준 한 건으로 합칩니다.

🤖 VLA & Embodied Foundation Models

지각·예측·행동·평가·개선을 하나의 시스템에서 자기 진화(Self-Evolving)로 수행하는 덱스터러스 매니퓰레이션(Dexterous Manipulation)용 일반 월드 모델(World Model).
Model / MethodDexterous Handworld modeldexterityVLA
arXiv AI 2026-08-26 ★★★★★
500회 이상의 실험을 통해 VLA(Vision-Language-Action) 설계 공간을 체계적으로 분석하고 12가지 실용 레시피를 도출한 VLANeXt는 약 97% 성공률을 달성.
Model / MethodCross-PlatformVLAfoundation modelopen source
인간 비디오(Human Video)로부터 인컨텍스트(In-Context) 방식으로 세계-행동(World-Action)을 모델링해 학습 시 본 적 없는 매니퓰레이션 태스크를 제로샷(Zero-Shot)으로 수행.
Model / MethodCross-Platformworld modelVLAimitation learning
여러 팔의 협조 매니퓰레이션과 새로운 팔 구성으로의 조합적 일반화(Compositional Generalization)를 지원하는 멀티암(Multi-Arm) VLA 아키텍처.
Model / MethodManipulatorVLAbimanual
원시 과거 프레임 대신 행동-일관적(Action-Consistent) 시간 맥락을 활용하도록 물리적 기반의 실행 이력(Execution History)을 VLA 정책에 인코딩해 롱-호라이즌(Long-Horizon) 매니퓰레이션 성능을 향상.
Model / MethodCross-PlatformVLA
arXiv Computer Vision 2026-08-29 ★★★★
이종의 인터넷 규모 비디오에서 엔드-이펙터(End-Effector) 자세와 언어를 조건으로 학습한 크로스-임보디먼트(Cross-Embodiment) 비디오 월드 모델로, 다양한 로봇 몸체에 대해 제로샷(Zero-Shot) 물리 시뮬레이션 제공.
Model / MethodCross-Platformworld modelVLA
인간 에고센트릭(Egocentric) 영상과 크로스-임보디먼트(Cross-Embodiment) 데이터를 활용해 접촉 위주 로봇 데이터 병목을 해소하는 팩터화된(Factorized) 월드 모델(World Model).
Model / MethodCross-Platformworld modelVLA
배포 중 로봇 자신의 물리 상호작용에서 실시간으로 학습해야 한다고 주장하며, 미관측 물리 조건에 대한 임보디드(Embodied) 매니퓰레이션을 인컨텍스트 인과 학습(In-Context Causal Learning)으로 적응.
Model / MethodCross-PlatformVLAsim2real
VLM(Vision-Language Model)의 공간 사전지식(Spatial Prior)을 끌어내 서로 다른 목표·환경·로봇 몸체에 걸쳐 임보디드 내비게이션(Embodied Navigation)을 수행하는 범용 정책.
Model / MethodCross-PlatformVLAnavigation
VLA 액션 전문가가 3D 기하와 2D 의미 특징을 충분히 활용하지 못함을 보이고, 비대칭 주입(Asymmetric Injection)으로 공간·의미 표현을 Action DiT에 명시적으로 회복시키는 V-Link 제안.
Model / MethodCross-PlatformVLA
의미(Semantic)·기하(Geometric)·동역학(Dynamic)·궤적(Trajectory) 네 종류의 전문가 토큰을 명시적 조건으로 사용해 자율주행 행동 계획을 안전하게 유도하는 CoWorld-VLA.
Model / MethodAutonomous VehicleVLAworld model

🖐 Manipulation & Dexterity

촉각(Tactile) 하드웨어, 대규모 멀티모달 데이터, 촉각 표현 학습, 표준 평가를 통합하는 촉각 지능(Tactile Intelligence) 임보디드 매니퓰레이션 패러다임 제안.
Model / MethodDexterous Handtactilefoundation modeldexterity
카메라·마커·힘/토크·촉각 센서 없이 온보드 자기감각(Proprioception)만으로 Unitree G1 휴머노이드에서 전신 매니퓰레이션(Whole-Body Manipulation)을 수행.
Model / MethodHumanoidwhole bodydexterityreal robot
6축 힘/토크(Force/Torque) 센싱을 플로우 매칭(Flow Matching) 행동 생성과 결합해 접촉 위주 매니퓰레이션에서 ForceVLA 대비 성공률 37% 향상 달성.
Model / MethodManipulatortactileVLAreal robot
arXiv Robotics 2026-08-26 ★★★★
SE(3) 기하를 존중하면서 다봉 그래스프(Grasp) 분포를 효율적으로 포착하는 리 군(Lie Group) 제약 기반 MeanFlow 생성 그래스핑 모델.
Model / MethodManipulatordexterity

🎯 Robot Learning, Control & Planning

추론 지연 상황에서 상태를 증강하고 추론 중 관측을 활용해 강화학습(Reinforcement Learning) 기반 VLA 개선을 가능케 하는 ARLI로, 대형 VLA를 실시간 온라인 RL과 호환.
Model / MethodCross-PlatformVLARL
배포 시 분포 변화(Distribution Shift)로 인한 근접 실패(Near-Miss)를 재학습 없이 상호작용 보정 신호로 활용해 생성적 플로우(Flow) 정책을 효율적으로 교정하는 FlowCorrect.
Model / MethodManipulatorimitation learningreal robot
엔트로피 기반 샘플 선택으로 인간 개입을 9.3% 줄이면서 실물 HIL(Human-in-the-Loop) 강화학습(Reinforcement Learning) 매니퓰레이션 성공률을 24.9% 향상.
Model / MethodManipulatorRLreal robot
성공 시연 하나를 경량 시각 보상 모델을 통해 진행도 인식(Progress-Aware) 밀집 보상으로 변환해 강화학습(Reinforcement Learning) 매니퓰레이션에 활용하는 RARM.
Model / MethodManipulatorRLimitation learning
arXiv Robotics 2026-08-27 ★★★☆☆
중요한 과거 경험을 메모리 앵커(Memory Anchor)로 식별해 신규 태스크의 연속 학습(Continual Learning) 중 파국적 망각(Catastrophic Forgetting) 없이 배포 정책에 새 스킬을 추가.
Model / MethodCross-Platformimitation learningRL
모델 기반 제어에서 학습된 반응 정책으로 넘어갈 때 태스크 의미(Semantics)를 유지하는 지속 프로그램(Persistent Program)으로 롱-호라이즌 매니퓰레이션의 사양을 보존.
Model / MethodManipulatorplanningimitation learning
자기감각(Proprioceptive) 단서로 검증된 태스크 진행 포인터를 유지하는 달성-근거 메모리(Achievement-Grounded Memory)로 동결된(Frozen) VLA 정책의 롱-호라이즌 태스크 완료를 지원.
Model / MethodCross-PlatformVLAplanning
인간 데이터 수집 없이 배포 시 실물-투-시뮬레이션(Real-to-Sim)으로 행동 레이블 시연을 생성해 새 작업 공간에 VLA 매니퓰레이션 정책을 적응시키는 DREAM.
Model / MethodManipulatorsim2realVLA

🦿 Locomotion & Whole-Body Control

평평한 지형을 넘어 희소한 3D 구조를 민첩하게 통과할 수 있는 지각형(Perceptive) 휴머노이드 이동 정책으로 전신 제어(Whole-Body Control)를 확장.
Model / MethodHumanoidlocomotionwhole bodyreal robot
명시적 상태 추정 없이 부분 관측성을 처리하도록 특권 표현 형성(Privileged Representation Shaping)을 사용한 다족 로봇의 종단간(End-to-End) 블라인드 보행.
Model / MethodLeggedlocomotionRLreal robot
선 상태의 지속적 관절 토크 부담을 줄이는 좌식(Seated) 로코-매니퓰레이션(Loco-Manipulation)의 첫 단계로, 수동 캐스터 체어 위에서의 전방향 휴머노이드 이동 학습.
Model / MethodHumanoidlocomotionwhole body

🧭 Mobility, Navigation & Autonomy

The Robot Report 2026-08-26 ★★★★
수만 시간의 현장 데이터를 학습한 개조 자율 굴착기(Autonomous Excavator)를 텍사스·네바다 실제 건설현장에 배치해 정지·절성토·기초 준비 작업을 운전자 없이 수행하는 Bedrock Robotics의 첫 상용 배포.
DeploymentGround Mobilereal robotimitation learning
사전학습된 X-Mobility 정책을 로봇별 잔차(Residual) 스페셜리스트로 강화학습(Reinforcement Learning) 적응시키는 NVIDIA COMPASS 에이전트 워크플로우; 창고·SAGE-10K 실내·NuRec 재구성 환경 지원.
Software / ToolGround MobilenavigationRLsim2real
arXiv Computer Vision 2026-08-26 ★★★★
느린 VLM 추론과 연속적 로봇 모션을 분리해 지연 병목을 제거함으로써 미지 환경에서 실시간 제로샷(Zero-Shot) 물체 내비게이션을 달성하는 RTNav.
Model / MethodGround Mobilenavigationefficient inferenceVLA
arXiv Robotics 2026-08-26 ★★★☆☆
파라메트릭 모방/강화학습(Imitation/RL)보다 풍부한 행동 궤적을 저장하는 어드밴티지 기반 명시적 메모리(Explicit Memory)로 사회적 내비게이션(Social Navigation)에서 상황 유사 상호작용을 회상.
Model / MethodGround MobilenavigationRLHRI

🚁 Aerial, Field, Marine & Multi-Robot

Hugging Face LeRobot 2026-08-27 ★★★★
Pollen Robotics(Hugging Face)가 카메라·깊이·LiDAR·온보드 AI 탑재의 $399·15자유도 이족(Biped) 로봇 Microduck을 공개; 7가지 강화학습(RL) 동작과 SDK·MuJoCo 시뮬레이션·RL 스택을 오픈소스로 제공.
System / HardwareLeggedlocomotionRLopen sourcereal robot
가정에서 사용자가 직접 스킬을 학습·공유할 수 있는 스킬 마켓플레이스를 지원하는 $1,688 양팔(Bimanual) 가정용 로봇 NORI A3(팔당 7+1 자유도, RGB 카메라 4대, LiDAR, 6~8시간 배터리).
System / HardwareMobile Manipulatorbimanualreal robotteleoperation
형상을 실시간으로 재구성하고 다중 로봇 협력 행동을 조율하는 텐세그리티(Tensegrity) 연속체 로봇으로 필드 태스크용 형상 가변(Shape-Changing) 플랫폼을 탐구.
System / HardwareMulti-Robotreal robot
얕은 수역 사진 리얼리즘을 넘어 심해(Deep-Sea) 자율 로봇에 필요한 물리·센서 기반 시뮬레이션을 제공하는 심해 로보틱스 시뮬레이터.
Software / ToolMarinesimulationsim2real
사실적 씬, 가상 센싱, 자율 내비게이션, 모션 플래닝, 매니퓰레이션을 통합 지원하는 Unity 기반 온실 농업 로봇 시뮬레이터 Agri-Sim.
Software / ToolMobile Manipulatorsimulationsim2real
달·화성·소행성 자원 획득을 위한 우주 로보틱스 시스템 서베이; 원격 감지에서 다중 로봇 채굴까지 6단계 자율성 프레임워크와 임보디드 지질학용 AI/월드모델(World Model) 데이터 공백을 제시.
Survey / AnalysisMulti-Robotplanning

📊 Data, Benchmarks, Simulation & Tools

Hugging Face Papers 2026-08-26 ★★★★
현행 비디오 생성 월드 모델(World Model)이 개별 그럴듯한 궤적이 아니라 물리 행동의 확률 분포를 재현하지 못함을 드러내는 벤치마크(PAWBench)와 평가 프로토콜(PAWEval).
BenchmarkCross-Platformworld model
패치 메모리(Patch Memory)로 지속 시뮬레이션 가능한 실시간 스트리밍 상호작용 월드 모델(World Model) Matrix-Game 3.5. 로보틱스·임보디드 에이전트 적용 명시.
Software / ToolCross-Platformworld modelsimulation
실제 실내 씬을 개별 편집 가능한 오브젝트 자산으로 복원하는 컴포저블 리얼-투-심(Composable Real-to-Sim) 파이프라인 Lucida — 로봇 시뮬레이션용 오브젝트 단위 재현 지원.
Software / ToolCross-Platformsimulationsim2real
The Robot Report 2026-09-01 ★★★★
물리 기반 4K 24fps 비디오를 시간 단위로 스트리밍 생성하고 실행 중 프롬프트 편집을 지원하는 파운데이션 월드 모델 Orbis. 로봇 학습·자율 시스템 테스트를 목표로 함.
Software / ToolCross-Platformworld modelsimulationfoundation model
단일 시점의 자기 가림·불완전 표면 가시성을 극복하기 위한 캘리브레이션된 양팔(Dual-Arm) RGB-D-IR 다시점 로봇 지각 데이터셋 DARP.
DatasetManipulatorbimanualopen source
VLM 기반 상위 계획과 신뢰성 있는 폐루프 행동 원시(Primitive)를 결합해 원거리 목표 추론과 물리 실행 그라운딩을 함께 달성하는 롱-호라이즌 내비게이션 프레임워크.
Software / ToolCross-PlatformplanningnavigationVLA
Hugging Face Datasets 2026-08-29 ★★★☆☆
SELF-VLA V2 포맷·30Hz 듀얼 카메라로 수집된 컴퓨터 분해 7종 태스크 350에피소드 데이터셋 DisAss(스크류잉·부품 제거·케이블 언플러깅 포함).
DatasetManipulatorbimanualopen source

🛠 Hardware, Sensing, Deployment & Safety

카메라 기반 촉각 스킨보다 저비용·저연산으로 풍부한 촉각 신호를 제공하는 분산 색상 센싱 기반의 소형 카메라리스 광학 촉각(Optical Tactile) 센서 SpectraTac.
System / HardwareDexterous Handtactilereal robot
제약된 엣지 디바이스(Edge Device)에서 인간 움직임 의도를 디코딩하는 유연 소재 기반 뉴로모터(Neuromotor) 인터페이스의 데이터 중심(Data-Centric) 접근.
System / HardwareCross-PlatformHRIefficient inferencedataset
The Robot Report 2026-08-31 ★★★☆☆
근접·힘/토크·촉각을 결합한 멀티모달 그리퍼(End-of-Arm Tooling)가 접촉 위주 매니퓰레이션에서 물리 AI(Physical AI) 모델이 요구하는 신뢰성 있는 실행 계층을 제공한다는 분석.
Survey / AnalysisManipulatortactiledexterity
저계수(Low-Rank) 가중치 섭동으로 VLA 모델의 인식적 불확실성(Epistemic Uncertainty)을 추정해 추가 파인튜닝 없이 분포 변화에서 실패를 검출하는 학습 불필요(Training-Free) 프레임워크.
Model / MethodCross-PlatformsafetyVLA
사용자 음성 인식(ASR) 오류가 임보디드 AI(Embodied AI) 모델의 안전하지 않은 출력을 유발할 수 있음을 조사, ASR 오류가 유해 지시로 이어짐을 실증.
Survey / AnalysisCross-PlatformsafetyHRI

🧠 Selected Robotics-Enabling AI

기하학적 비전 파운데이션 모델(Vision Foundation Model)에 자기감각(Proprioception) 피드백과 토큰 재사용을 결합해 로봇 매니퓰레이션 정책의 공간 그라운딩을 강화하고 추론 지연을 줄이는 VGGT-DP.
Model / MethodCross-Platformfoundation modelVLAefficient inference
사전학습 멀티모달 LLM(Multimodal LLM)을 에피소드 단위 컨텍스트 엔진으로 활용해 긴 시각 이력과 다단계 추론을 통합, 부분 관측 상황의 로봇 제어를 개선한 PonderPounce.
Model / MethodCross-Platformfoundation modelVLA

🔭 Frontier AI

언어 모델에 국한하지 않은 범용 파운데이션 모델의 주요 신규 공개

Anthropic 2026-09-01 Flagship
Anthropic이 최상위 코딩·지식 작업 모델인 Claude Fable 5.1(공개)과 Mythos 5.1(제한 공개)을 출시. Fable 5 대비 캐시 리드 비용 약 25% 절감.
Language · Code · ReasoningNew ModelModel / Methodfoundation model
OpenAI가 Preparedness Framework의 '치명(Critical)' 사이버보안 역량 임계에 처음 도달한 모델 Astra를 공개하며, 배포 안전장치도 함께 강화.
Language · Code · ReasoningTechnical ReportModel / Methodfoundation modelsafety
Tencent이 1M 컨텍스트를 지원하는 770B MoE(활성 49B) LLM인 Hy4를 오픈소스로 공개. 소프트웨어 엔지니어링·자율 태스크에서 강한 성능, Tencent Cloud·OpenRouter API 제공.
Language · Code · ReasoningOpen WeightsModel / Methodfoundation modelopen weights
743B GLM-5 베이스에서 코딩·사이버보안용으로 후속학습된 GLM-5.3. GLM-5.2 대비 코딩 성능 50% 향상, Terminal Bench 3.0·Agents' Last Exam에서 오픈웨이트(Open-Weights) 1위.
Language · Code · ReasoningPublic APIModel / Methodfoundation modelopen weights
Hugging Face Models 2026-08-31 Major
DeepSeek V4-Flash 계열 최초의 실험적 멀티모달 모델(305B)로 V4-Flash 아키텍처에 시각 이해를 추가; SOTA 멀티모달 에이전트 성능과 MIT 오픈웨이트 제공.
Multimodal · OmniOpen WeightsModel / Methodfoundation modelopen weights
Google 멀티모달 비디오 생성 API의 대규모 업데이트: 10초 씬 컨텍스트로 자연스러운 확장, 키프레임 제어, 360p 드래프트 모드(60% 빠름, 비용 1/3), 4K 업스케일링 추가.
Video · World ModelMajor UpdateModel / Methodfoundation model
GLM-5.3 패밀리 최초의 네이티브 멀티모달 모델 GLM-5.3-Flash (총 320B/활성 18B, MIT 라이선스 오픈웨이트)를 Zhipu AI가 공개.
Multimodal · OmniOpen WeightsModel / Methodfoundation modelopen weights
Qwen4 아키텍처를 미리 보이는 125B/활성 6B MoE 오픈웨이트 멀티모달 모델 Qwen3.8-Flash-Next 공개(하이브리드 GatedDeltaNet+QSA 어텐션, N-그램 임베딩, 1M 컨텍스트, 텍스트·이미지·비디오 지원).
Multimodal · OmniOpen WeightsModel / Methodfoundation modelopen weights
Google Research가 TimesFM 3.0 오픈웨이트 공개: 다변량(Multivariate) 예측을 네이티브 지원하고 공변량(Covariate)까지 유연히 다루는 0.3B 시계열 파운데이션 모델. 3대 TS FM 벤치마크의 제로샷 성능 1위.
Scientific · StructuredOpen WeightsModel / Methodfoundation modelopen weights