Troving Test on 스크린: 모바일 GUI 에이전트 인공화 능력 평가
이 연구에서는 모바일 GUI 에이전트가 인공화 능력을 갖출 수 있도록 하기 위해 'Troving Test on 스크린' 이라는 새로운 평가 지표를 제안합니다. 이 평가 지표는 에이전트가 자연스러운 동작을 구현하는지 여부를 평가합니다. 연구 결과, 대규모 언어 모델(LLM) 기반 에이전트는 자연스러운 동작을 구현하지 못하여 쉽게 감지됩니다. 따라서 연구에서는 에이전트 인공화 능력을 평가하기 위한 새로운 지표인 에이전트 인공화 능력 평가 지표(Agent Humanization Benchmark, AHB)를 제안합니다.