에이전트 4월 24일
장기 보수를 위한 LLM 의사결정 및 기술 은행 에이전트의 공동 진화
장기 보수를 위한 환경은 에이전트의 기술 사용 능력을 평가하는 데 적합한 테스트베드입니다. 이러한 환경은 다단계 논리 reasoning, 여러 스텝에 걸친 기술 연쇄, 지연 보상 및 부분 관찰 가능성 하에서 안정적인 의사결정을 요구합니다. 게임은 에이전트의 기술 사용을 평가하는 데 적합한 테스트베드입니다. 대규모 언어 모델(LLM)은 게임 플레이 에이전트로 유망한 대안을 제공하지만, 장기 보수 의사결정에 대한 일관된 성능을 달성하기 어렵습니다. 이는 에이전트가 에피소드 간에 구조화된 기술을 발견, 보존, 재사용하는 메커니즘을 갖고 있지 않기 때문입니다. 저자는 COSPLAY라는 공동 진화 프레임워크를 제안합니다. 이 프레임워크는 LLM 의사결정 에이전트가 기술 은행에서 기술을 검색하여 행동을 취하는 동안, 에이전트 관리 기술 파이프라인이 에이전트의 unlabeled rollouts에서 재사용 가능한 기술을 발견하여 기술 은행을 형성합니다. 이 프레임워크는 에이전트의 기술 검색 및 행동 생성 능력을 향상시키는 동시에, 기술 은행 에이전트가 기술과 그 계약과 함께 지속적으로 추출, 정제, 업데이트합니다.