로직의 대화: BALAR, 인간과 대화하는 대규모 언어 모델(LLM)의 능동적 사고
대규모 언어 모델(LLM)은 사용자와의 다중 라운드 정보 교환을 필요로 하는 인터랙티브 설정에서 점점 더 많이 작동하고 있습니다. 그러나 대부분의 현재 시스템은 대화에 반응적으로 다루고, 정보가 누락된 것을(reasoning about what information is missing) 및 다음에 질문을 선택하는(principled mechanism to reason about which question should be asked next) 데 대한 원리적인 메커니즘을 가지고 있지 않습니다. BALAR(Bayesian Agentic Loop for Active Reasoning)이라는 새로운 알고리즘을 제안합니다. 이 알고리즘은 task-agnostic outer-loop 알고리즘으로, fine-tuning이 필요하지 않고 대규모 언어 모델(LLM) 에이전트와 사용자 간의 구조화된 다중 라운드 상호 작용을 허용합니다. BALAR은 latent states에 대한 구조화된 믿음을 유지하고, expected mutual information을 최대화하여 clarifying 질문을 선택하고, 현재 상태 표현이 부족할 때 동적으로 상태 표현을 확장합니다. BALAR은 detective cases, thinking puzzles, clinical diagnosis과 같은 다양한 벤치마크에서 모든 baseline을 능동적으로 물리치고, AR-Bench-DC에서 14.6%의 정확도 향상, AR-Bench-SP에서 38.5%의 정확도 향상, iCraft-MD에서 30.5%의 정확도 향상이 있습니다.