본문으로 건너뛰기

분해된 사고와 행동을 위한 신뢰할 수 있는 인공지능-agent

AI 자동 생성

ReAct 기반 agent는 일반적으로 단일 대규모 언어 모델(LLM) 정책을 사용하여 행동을 제안하고 환경과 상호작용하며 작업이 완료되었는지 결정합니다. 이러한 결합은 독립적으로 행동 인증 및 완료 제어를 강제하기 어렵게 만들고, 오류가 전파되고 지원되지 않는 완료 주장을 실행 중지로 이어질 수 있습니다. 우리는 DeReAct라는 모듈형 agent 아키텍처를 소개합니다. DeReAct는 두 개의 게이트 정책을 외부화합니다: 행동을 실행하기 전에 유효성을 검사하는 Critic 및 환경이 지원하는 State를 재구성하고 작업 완료를 인증하는 Context Manager. GAIA 및 SWE-bench Verified에서 DeReAct는 약한 Brain 모델에 대해 Pass@1에서 가장 많이 향상되며, Qwen3-Coder-480B의 경우 6.5--7.0 점의 이익이 있고 Claude Sonnet~4.5의 경우 4.2--5.2 점의 이익이 있습니다. Brain 능력이 증가함에 따라 이익은 감소합니다. 트레젝토리 및 절단 분석은 외부 게이트가 충분히 빈번한 대상 실패가 있는 경우 효과적이고 게이트 정책이 충분할 때 게이트 정책이 효과적임을 보여줍니다. Claude Opus~4.5의 경우 Pass@1은 ReAct와 비교할 때 비슷하지만 DeReAct는 더 많은 증거를 포함하고 제약을 충족하는 트레젝토리를 생성합니다. 이는 완료 제어가 더 강한 기반을 갖기 위해 더 일찍 종료하는 데 거래할 수 있음을 나타냅니다. 총괄적으로 DeReAct는 약한 agent를 개선하면서 모델이 강화됨에 따라 지반 이점을 유지합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 1일 전

메타가 Muse AI 기기를 만드는 코드를 공개합니다.

메타(Meta)는 이제 여러분이 회사에서 개발한 새로운 인공지능 agent를 특징으로 하는 Muse 기기를 만드는 데 사용할 수 있는 코드를 오픈 소스화했습니다. 회사에서는 Muse를 색상 E Ink 디스플레이에 로드하여 nhắc음을 표시하는 프로젝트, HDMI 스틱에 추가하여 큰 화면에서 Muse를 표시하는 프로젝트 등 다양한 아이디어를 제안합니다.

에이전트 2일 전

장기 언어_AGENT의 중량 꼬리 메모리 트레이스

장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.