자기 최적화자로 작동하는 agent가 여러 업무를 위한 자체 진화하는 핸들
연구자들은 대규모 언어 모델(LLM) 에 대한 코드를 조정하는 방법을 연구하고 있습니다. 이 코드를 '하네스'라고 합니다. 하네스는 언어 모델 에이전트를 조직하고, 도구를 호출하고, 컨텍스트를 관리하며, 실행을 제어합니다. 언어 모델이 더 강해질수록 최근 연구에서는 에이전트가 자신의 하네스를 개선하는 방법을 연구하고 있습니다. 이 방법을 '자신이 진화하는 하네스'라고 합니다. 현재 대부분의 방법은 인간이 설계한 하네스를 사용하여 해결책의 하네스를 수정하고, 각 벤치마크마다 별도의 하네스를 진화하는 방법을 사용하고 있습니다. 하지만 실세계의 문제는 다양한 도메인에서 발생하므로, 하네스의 진화와 평가도 다양한 도메인의 문제를 포함해야 합니다. 우리는 하네스의 진화 과정을 두 단계로 나누어 보았습니다. 첫 단계는 다중 태스크 프리트레이닝이고, 두 번째 단계는 지속적인 트레이닝입니다. 시작점으로 49라인의 하네스를 사용하고, 첫 단계의 하네스는 인-디스트리뷰션 벤치마크에서 평균 점수 4.48점을 향상시키고, 아웃-오브-디스트리뷰션 벤치마크에서 평균 점수 12.64점을 향상시켰습니다. 또한 Codex를 초과했습니다. 두 번째 단계에서는 Claw-Eval이라는 아웃-오브-디스트리뷰션 벤치마크에서 계속 진화하여 점수를 66.17점에서 68.06점으로 향상시켰습니다. 이 결과는 Codex를 초과했습니다. 또한 하네스의 진화 과정에서 발생한 기계증체계를 자세히 분석하였습니다. 이 기계증체계는 출력 자르기, 역사 압축, independent review 등이 포함됩니다.
함께 읽으면 좋은 기사
쇼피프가 선보인 캔버스, AI와 대화하며 온라인 매장을 만드는 방법
쇼피프의 새로운 캔버스(Canvas) 사이트 빌더는 판매자들이 AI agent인 사이드 킥(Sidekick)과 대화하며 온라인 상점을 만들고 커스터마이징할 수 있게 해줍니다. 이 과정을 실시간으로 보면서 진행할 수 있습니다.
에어비앤비의 차세대 운영 체제: 인공지능 agent의 자율성 필요하다
에어비앤비 창업자 브라이언 체스키(Brian Chesky)는 인공지능 agent를 위해 자체 운영 체제가 필요하다고 말합니다. 그는 또한 소비자 인공지능의 현재 상태와 인공지능이 가진 잠재력을 강조합니다.
오픈아이, 메타와 경쟁하기 위해 '도트'를 출시하다
오픈아이가 메타의 마인드(Muse) AI agent 플랫폼에 도전하기 위해 '도트(Dots)'라는 새로운 agent를 출시했다. 이 agent는 GPT-6 Astra를 기반으로 하고 있으며, 메타의 마인드 플랫폼의 성공에 도전한다.
장기 언어_AGENT의 중량 꼬리 메모리 트레이스
장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감
메타, 뮤즈가 사용자의 사생활 메시지를 읽었다는 주장에 반박한다
메타는 뮤즈 AI agent가 사용자의 사생활 메시지를 읽는 것을 허용하지 않는다고 밝혔다. 뮤즈는 사용자의 사생활 메시지를 읽었을 가능성이 있다. 하지만 사용자가 Mac의 특정 설정을 끄지 않았다면.
도어 대시, 음식 주문 AI agent 출시... 경쟁자들과의 경쟁 강화
도어 대시는 우버 이츠와 그루브 훅을 제치기 위해 음식 주문 AI agent를 출시했다. 사용자는 SMS로 AI agent와 음식 주문을 하게 될 예정이다. 이 기술은 대규모 언어 모델(LLM)과 자연어 처리(NLP)를 기반으로 한다.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.