본문으로 건너뛰기

Pro$^2$Assist: Long-Horizon Procedural Tasks를 위한 멀티모델 자존심적 인 인식과 함께 지속적인 단계적 인 예방적 지원

인공 지능이 지원하는 개인 보조기(Pro$^2$Assist) : 지속적인 단계 인식에 기반한 대비적 보조기와 멀티모달 에โก 센트릭 인식으로 인한 장기 절차적인 작업의 지원 장기 절차적인 작업은 일상 생활에서 흔히 볼 수 있는 작업들이다. 최근 대규모 언어 모델(LLM)의 발전으로 인해 일상 활동을 지원하는 개인 보조기들이 등장했다. 하지만 기존의 시스템들은 주로 사용자의 질의에 의해 트리거되는 반응적인 지침 제공 또는 격리된 단기 사건에 대한 제한적인 대비적 보조기 제공에 그치고 장기 절차적인

AI 자동 생성

Pro$^2$Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural Tasks

인공 지능이 지원하는 개인 보조기(Pro$^2$Assist) : 지속적인 단계 인식에 기반한 대비적 보조기와 멀티모달 에โก 센트릭 인식으로 인한 장기 절차적인 작업의 지원

장기 절차적인 작업은 일상 생활에서 흔히 볼 수 있는 작업들이다. 최근 대규모 언어 모델(LLM)의 발전으로 인해 일상 활동을 지원하는 개인 보조기들이 등장했다. 하지만 기존의 시스템들은 주로 사용자의 질의에 의해 트리거되는 반응적인 지침 제공 또는 격리된 단기 사건에 대한 제한적인 대비적 보조기 제공에 그치고 장기 절차적인 작업에 대한 보조기 제공에 한계가 있다. 이 연구에서 우리는 대비적 보조기인 Pro$^2$Assist를 소개한다. Pro$^2$Assist는 작업 진행의 미세한 단계를 지속적으로 추적하고 사용자의 진화하는 상태에 대한 사유를 통해 작업 중에 사용자에게 필요한 지원을 제공한다. Pro$^2$Assist는 증강 현실(AR) 글래스를 통해 운동 기반 인식을 달성하고 다중 스케일의 시간적 동적 및 작업에 대한 전문 지식에 기반한 절차적 내용을 추출한다. 사용자 입력과 절차적 내용에 기반하여 Pro$^2$Assist는 지속적인 사유를 통해 사용자의 필요를 추론하고 AR 글래스에 필요한 지원을 제공한다.

Pro$^2$Assist를 평가하기 위해 우리는 공공 소스에서 구축한 데이터셋과 증강 현실 글래스를 사용하여 수집한 실제 데이터셋을 사용했다. 광범위한 평가 결과에 따르면 Pro$^2$Assist는 절차적 행동 이해 정확도에서 21% 이상의 성능을 보였고, 대비적 타이밍 정확도에서 2.29배의 성능을 보였다. 20명의 참가자와의 사용자 연구 결과, 90%의 참가자가 Pro$^2$Assist가 실제 절차적 보조기로서 효과적이라고 응답했다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

LLM PC 8월 15일

LLM이 핵 공격을 추천하지 않으려면? 일본어로 물어보세요

대규모 언어 모델은 점점 더 전략적이고 자문적인 상황에서 사용되고 있지만, 그 안전성은 일반적으로 영어만으로 평가됩니다. 우리는 여섯 개의 제공업체에서 나온 9개의 모델을 테스트하고, 언어가 모델의 결정을 바꾸는지-high stakes 상황에서-확인하려고 합니다. 우리는 단일 턴 게임 이론적 시나리오에서 사용하며, 모델은 무방비 상대에게 핵무기를 사용할 것인지 여부를 일본의 국가에 자문합니다

LLM PC 8월 13일

Bayesian 모델 칼리브레이션을 위한 문헌 정보를 기반으로 한 전역 분포 설계

Bayesian 기반의 프로세스 기반 모델의 감리 작업을 위해서는 각 모델의 매개변수에 대한 사전 분포가 필요하다. 많은 연구자들은 이 작업을 수행하기 위해 유니폼 사전 분포를 사용한다. 하지만 유니폼 사전 분포를 사용하는 이유는 이 작업을 수행하기 위한 도메인 지식과 통계 지식이 필요하고, 이를 통해 유의미한 사전 분포를 구축하는 데 시간이 많이 걸린다는 것이다. 우리는 Distribird

LLM PC 8월 10일

세계 모델에서 중요한 것에 집중하는 TaskSense

대규모 언어 모델(LLM)을 통해 학습된 시각적 제어 모델은 일반적으로 compact한 잠재 상태를 학습하기 위해 관찰치를 재구성하는 것을 통해 정보를 전체 시각적 입력에 걸쳐 보존하도록 암묵적으로 장려합니다. 그러나 과제 관련 내용은 관찰치의 작은 부분만을 차지하며 배경 잡음 및 가리키는 요소는 유용한 표현적 능력을 소모합니다. 시각 재구성과 제어 목표 사이의 불일치로 인해 잠재 표현은 과

LLM PC 8월 10일

중간 층의 주의 집중 예측을 통해 시각 토큰 압축

대규모 멀티모달 언어 모델(Multimodal Large Language Model, MLLM)의 효율성을 향상시키기 위해 시각 토큰 압축을 사용하는 방법을 제안합니다. 이 방법은 중간 언어 모델 층의 주의 집중을 예측하여 시각 토큰의 중요도를 평가합니다. 이 방법은 existing inference acceleration techniques와 호환되며, 10개의 benchmark에서 97.5%의 unpruned model 성능을 유지하며, 5.56%의 시각 토큰만 사용하여 3.09배의 end-to-end speedup을 달성합니다.

LLM PC 8월 7일

Ignition 지수: 언어 모델의 글로벌 워크스페이스 동적 측정

Ignition Index를 제시합니다. 이는 전이 모델 언어 모델에서 Global Workspace Theory의 (GWT) 모든-아니면-점화 예측을 operationalize하는 유효한 스칼라 지표입니다. 이 지표는 입력 신호 강도의 함수로 per-layer 선형 프로브 정확도를 4-매개 변수 시그모이드에 적합시켜, 기울기 매개변수 beta-hat을 추출합니다: 높은 값은 급격한, 점화와

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.