본문으로 건너뛰기

다음 환경에서 작업하기 전 무작정 메모리 구축: Preping

이 연구에서는 무작정 메모리를 구축하는 방법을 연구한다. 무작정 메모리는 offline에서 커데이션된 데모레이션으로 구축하거나 online에서 포스트-배포 인터랙션으로 구축할 수 있다. 그러나 무작정 메모리는 새로운 환경에 처음 도입되었을 때 작업에 특화된 경험을 제공하지 않는 경우 cold-start gap을 마주한다. 이 연구에서는 무작정 메모리를 구축하기 전에 다음 환경의 경험을 제공하지 않는 경우 대규모 언어 모델(LLM)과 같은 메모리를 구축하는 방법을 연구한다.

AI 자동 생성

무작정 메모리 구축

무작정 메모리는 다음 환경에 처음 도입되었을 때 작업에 특화된 경험을 제공하지 않는 경우 cold-start gap을 마주한다. 이 연구에서는 무작정 메모리를 구축하기 전에 다음 환경의 경험을 제공하지 않는 경우 대규모 언어 모델(LLM)과 같은 메모리를 구축하는 방법을 연구한다.

Preping 프레임워크

Preping 프레임워크는 proposer-guided 메모리 구축 프레임워크이다. 이 프레임워크의 핵심은 proposer 메모리이다. proposer 메모리는 future practice를 shape하는 구조된 control state이다. proposer는 이 state에 기반하여 synthetic task를 생성하고, solver는 이 task를 실행하고, validator는 이 trajectory가 메모리에 저장될 자격이 있는지 결정한다. validator는 또한 future proposal를 guide하는 feedback를 제공한다.

실험 결과

AppWorld, BFCL v3, MCP-Universe에서 실험한 결과, Preping은 no-memory baseline보다 성능이 월등히 향상되었고, offline 또는 online 경험으로 구축된 강력한 플레이북 기반 메서드와 성능이 비슷하였다. AppWorld와 BFCL v3에서 online 메모리 구축보다 deployment cost가 $2.99 imes$와 $2.23 imes$ 낮았다.

결론

Preping 프레임워크는 다음 환경에서 작업하기 전 무작정 메모리를 구축하는 데 도움이 된다. 이 프레임워크는 proposer-side control을 통해 feasiblity, redundancy, coverage를 제어하고, selective memory updates를 통해 메모리를 업데이트할 수 있다. 이러한 제어와 업데이트는 Preping이 성능을 향상시키는 데 도움이 된다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 18시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.