Analyzing Physical Prior Transfer and Efficient Visual Information Selection for Video-Action Models
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066256
교육부
한국연구재단
대구경북과학기술원
이시형
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
응용연구
대학
대구광역시 달성군
기계 > 로봇/자동화기계 > 로봇 제어/지능화기술
... backbone이 필요한가? 이 질문은 단순한 모델 크기 비교가 아니라, 비디오 기반 로봇 정책의 성능 원천이 어디에 있는지를 묻는 문제이다.또 하나의 문제는 backbone이 학습한 모든 시각 정보를 action decoder에 전달하는 방식이 실제로 필요한지 여부이다. Unified Video Action Model은 joint video-action latent representation과 ...
본 연구는 크게 두 가지 축으로 구성된다. 첫 번째 축은 비디오 backbone의 규모가 물리적 사전지식 전달에 미치는 영향을 분석하는 것이고, 두 번째 축은 행동 관련 시각 정보만 선택적으로 전달하는 효율적 추론 구조를 설계하고 검증하는 것이다. 본 연구의 초점은 단순한 시각 생성 품질 비교가 아니라, backbone이 학습한 시공간 표현이 행동 생성에 유효한 ...
... backbone 규모가 실제 물리적 priors 전달에 어떤 영향을 미치는지, 그리고 전체 시각 정보를 모두 사용하지 않고도 action-relevant한 정보만으로 충분한 제어 성능을 확보할 ... 모델 전체를 매 단계 활용하는 방식보다 훨씬 효율적인 정책 구조를 설계할 수 있다. 이는 제한된 계산 자원에서도 활용 가능한 실시간 로봇 제어 시스템 개발의 기초 자료가 될 수 있다.