장기 사용자 상호작용에서 embodie된 다중 모드 언어 모델 에이전트 개인화
대규모 멀티모달 언어 모델(LLLM)- 기반 몸체(agent)가 물리 환경에서 복잡한 작업을 해결하는 데 강력한 잠재력을 보인다. 하지만 개인화된 지원은 일반적인 지시를 따르거나 물체 카테고리만 식별하는 것보다 더 필요하다. 실제 세계 시나리오에서 목표는 종종 이전 상호 작용을 통해 암시적으로만 지정되며, 시간이 지남에 따라 축적된 개인화된 맥락을 활용하여 agent가 개인화된 맥락과 시각적