본문으로 건너뛰기

AREX-2: 장기적인 반영적 과제를 통해 개선 가능한 agent를 향상시키기

AI 자동 생성

arXiv:2609.38288v1 발표 형식: 새로운 발표 요약: AREX-2를 소개합니다. 이는 대규모 언어 모델(LLM) agent의 자체 개선 능력을 향상시키기 위한 노력으로, 테스트 시간에 iteratively 솔루션을 개선할 수 있는 능력을 정의합니다. 이 능력은 두 가지 상호 보완적인 능력에 기초합니다: 반사성(reflection), 현재 솔루션보다 더 나은 솔루션을 생성하는 것, 그리고 장거리 실행(long-horizon execution), 반복이 효과적이도록 여러 라운드 동안 유지하는 것. 우리는 두 가지 능력이 도메인에 무관하다는 가설을 세우고, 감독을 위해 적합한 scenario에서 학습할 수 있다는 것을 확인합니다. 따라서 우리는 machine learning과 algorithmic programming task 두 가지 도메인에서 verifiable feedback와 reward를 받는 sustained iteration을 합성합니다. 이 데이터로 학습한 agent는 Qwen3.8-27B에 기반을 둔 agent로, MLE-bench Lite (81.8)와 Frontier-CS (70.7)에 강력한 결과를 나타내며, BrowseComp (84.0), HLE (52.6), GAIA (92.2), DeepSearchQA (93.8)와 같은 깊은 연구에 이식되며, 반복 횟수의 budget이 증가함에 따라 계속 개선됩니다. 이러한 결과는 장거리 반사 데이터가 자체 개선 agent를 향한 효과적인 경로라고 보여줍니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 4시간 전

분해된 사고와 행동을 위한 신뢰할 수 있는 인공지능-agent

ReAct 기반 agent는 일반적으로 단일 대규모 언어 모델(LLM) 정책을 사용하여 행동을 제안하고 환경과 상호작용하며 작업이 완료되었는지 결정합니다. 이러한 결합은 독립적으로 행동 인증 및 완료 제어를 강제하기 어렵게 만들고, 오류가 전파되고 지원되지 않는 완료 주장을 실행 중지로 이어질 수 있습니다. 우리는 DeReAct라는 모듈형 agent 아키텍처를 소개합니다. DeReAct는 두

에이전트 1일 전

메타가 Muse AI 기기를 만드는 코드를 공개합니다.

메타(Meta)는 이제 여러분이 회사에서 개발한 새로운 인공지능 agent를 특징으로 하는 Muse 기기를 만드는 데 사용할 수 있는 코드를 오픈 소스화했습니다. 회사에서는 Muse를 색상 E Ink 디스플레이에 로드하여 nhắc음을 표시하는 프로젝트, HDMI 스틱에 추가하여 큰 화면에서 Muse를 표시하는 프로젝트 등 다양한 아이디어를 제안합니다.

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.