AREX-2: 장기적인 반영적 과제를 통해 개선 가능한 agent를 향상시키기
arXiv:2609.38288v1 발표 형식: 새로운 발표 요약: AREX-2를 소개합니다. 이는 대규모 언어 모델(LLM) agent의 자체 개선 능력을 향상시키기 위한 노력으로, 테스트 시간에 iteratively 솔루션을 개선할 수 있는 능력을 정의합니다. 이 능력은 두 가지 상호 보완적인 능력에 기초합니다: 반사성(reflection), 현재 솔루션보다 더 나은 솔루션을 생성하는 것, 그리고 장거리 실행(long-horizon execution), 반복이 효과적이도록 여러 라운드 동안 유지하는 것. 우리는 두 가지 능력이 도메인에 무관하다는 가설을 세우고, 감독을 위해 적합한 scenario에서 학습할 수 있다는 것을 확인합니다. 따라서 우리는 machine learning과 algorithmic programming task 두 가지 도메인에서 verifiable feedback와 reward를 받는 sustained iteration을 합성합니다. 이 데이터로 학습한 agent는 Qwen3.8-27B에 기반을 둔 agent로, MLE-bench Lite (81.8)와 Frontier-CS (70.7)에 강력한 결과를 나타내며, BrowseComp (84.0), HLE (52.6), GAIA (92.2), DeepSearchQA (93.8)와 같은 깊은 연구에 이식되며, 반복 횟수의 budget이 증가함에 따라 계속 개선됩니다. 이러한 결과는 장거리 반사 데이터가 자체 개선 agent를 향한 효과적인 경로라고 보여줍니다.
함께 읽으면 좋은 기사
분해된 사고와 행동을 위한 신뢰할 수 있는 인공지능-agent
ReAct 기반 agent는 일반적으로 단일 대규모 언어 모델(LLM) 정책을 사용하여 행동을 제안하고 환경과 상호작용하며 작업이 완료되었는지 결정합니다. 이러한 결합은 독립적으로 행동 인증 및 완료 제어를 강제하기 어렵게 만들고, 오류가 전파되고 지원되지 않는 완료 주장을 실행 중지로 이어질 수 있습니다. 우리는 DeReAct라는 모듈형 agent 아키텍처를 소개합니다. DeReAct는 두
메타가 Muse AI 기기를 만드는 코드를 공개합니다.
메타(Meta)는 이제 여러분이 회사에서 개발한 새로운 인공지능 agent를 특징으로 하는 Muse 기기를 만드는 데 사용할 수 있는 코드를 오픈 소스화했습니다. 회사에서는 Muse를 색상 E Ink 디스플레이에 로드하여 nhắc음을 표시하는 프로젝트, HDMI 스틱에 추가하여 큰 화면에서 Muse를 표시하는 프로젝트 등 다양한 아이디어를 제안합니다.
오픈에이아이의 Dot agent는 기업용 소프트웨어로 식사 주문까지 가능하다
오픈아이의 새로운 agent 플랫폼인 Dots는 귀여운 작은 친구들이 많아 주문에 따라 행동하는 모습을 보여줍니다. 그러나 메타 뮤즈 같은 친숙한 느낌보다는, Dots는 사용자가 일을 처리하는 도구에 부가 기능으로 음식을 주문할 수 있는 기능을 제공하는 것처럼 느껴집니다.
쇼피프가 선보인 캔버스, AI와 대화하며 온라인 매장을 만드는 방법
쇼피프의 새로운 캔버스(Canvas) 사이트 빌더는 판매자들이 AI agent인 사이드 킥(Sidekick)과 대화하며 온라인 상점을 만들고 커스터마이징할 수 있게 해줍니다. 이 과정을 실시간으로 보면서 진행할 수 있습니다.
에어비앤비의 차세대 운영 체제: 인공지능 agent의 자율성 필요하다
에어비앤비 창업자 브라이언 체스키(Brian Chesky)는 인공지능 agent를 위해 자체 운영 체제가 필요하다고 말합니다. 그는 또한 소비자 인공지능의 현재 상태와 인공지능이 가진 잠재력을 강조합니다.
오픈아이, 메타와 경쟁하기 위해 '도트'를 출시하다
오픈아이가 메타의 마인드(Muse) AI agent 플랫폼에 도전하기 위해 '도트(Dots)'라는 새로운 agent를 출시했다. 이 agent는 GPT-6 Astra를 기반으로 하고 있으며, 메타의 마인드 플랫폼의 성공에 도전한다.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.