본문으로 건너뛰기

자기 최적화자로 작동하는 agent가 여러 업무를 위한 자체 진화하는 핸들

AI 자동 생성

연구자들은 대규모 언어 모델(LLM) 에 대한 코드를 조정하는 방법을 연구하고 있습니다. 이 코드를 '하네스'라고 합니다. 하네스는 언어 모델 에이전트를 조직하고, 도구를 호출하고, 컨텍스트를 관리하며, 실행을 제어합니다. 언어 모델이 더 강해질수록 최근 연구에서는 에이전트가 자신의 하네스를 개선하는 방법을 연구하고 있습니다. 이 방법을 '자신이 진화하는 하네스'라고 합니다. 현재 대부분의 방법은 인간이 설계한 하네스를 사용하여 해결책의 하네스를 수정하고, 각 벤치마크마다 별도의 하네스를 진화하는 방법을 사용하고 있습니다. 하지만 실세계의 문제는 다양한 도메인에서 발생하므로, 하네스의 진화와 평가도 다양한 도메인의 문제를 포함해야 합니다. 우리는 하네스의 진화 과정을 두 단계로 나누어 보았습니다. 첫 단계는 다중 태스크 프리트레이닝이고, 두 번째 단계는 지속적인 트레이닝입니다. 시작점으로 49라인의 하네스를 사용하고, 첫 단계의 하네스는 인-디스트리뷰션 벤치마크에서 평균 점수 4.48점을 향상시키고, 아웃-오브-디스트리뷰션 벤치마크에서 평균 점수 12.64점을 향상시켰습니다. 또한 Codex를 초과했습니다. 두 번째 단계에서는 Claw-Eval이라는 아웃-오브-디스트리뷰션 벤치마크에서 계속 진화하여 점수를 66.17점에서 68.06점으로 향상시켰습니다. 이 결과는 Codex를 초과했습니다. 또한 하네스의 진화 과정에서 발생한 기계증체계를 자세히 분석하였습니다. 이 기계증체계는 출력 자르기, 역사 압축, independent review 등이 포함됩니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 16시간 전

장기 언어_AGENT의 중량 꼬리 메모리 트레이스

장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.