도구 기반 최적화: 의도적인 행동 최적화에 대한 명시적 세계 모델
대규모 언어 모델(LLM) 에이전트의 성능은 고정 모델 주변의 scaffold 의 개선에 따라 결정된다. scaffold 를 개선하기 위한 일반적인 방법 중 하나는 코드 에이전트를 최적화 기법으로 사용하는 것이다. 코드 에이전트는 현재 점수와 추적 정보를 읽어 소스 코드를 반복적으로 편집하고, 새로운 후보를 생성한다. 각 편집은 환경이 반응할 것이라는 믿음에 따라 선택된다. 이 믿음은 일반적