본문으로 건너뛰기

ARC-AGI-1에서 비용 효과적인 에이전트 하네스

AI 연구진은 새로운 에이전트 하네스 기술을 발표했다. 이 기술은 대규모 언어 모델(LLM)과 같은 고성능 모델을 필요로 하지 않고도 abstract reasoning과 generalization을 가능하게 한다. 연구진은 이 기술을 사용하여 ARC-AGI-1의 400-task 평가 집합에서 57.50%의 pass@2를 달성했으며, 이 성능은 \$0.25의 비용으로 달성되었다.

AI 자동 생성

비용 효과적인 에이전트 하네스

ARC-AGI-1에서 최근 진행된 연구는 두 가지 주요 방식으로 진행되었다. 첫 번째는 frontier 모델에 대해 heavy test-time compute를 사용하는 방법이며, 두 번째는 benchmark-specific training을 사용하는 방법이다. 하지만 이러한 방법들은 모두 높은 비용을 필요로 한다.

이러한 문제를 해결하기 위해 연구진은 새로운 에이전트 하네스 기술을 발표했다. 이 기술은 대규모 언어 모델(LLM)과 같은 고성능 모델을 필요로 하지 않고도 abstract reasoning과 generalization을 가능하게 한다.

연구진은 이 기술을 사용하여 ARC-AGI-1의 400-task 평가 집합에서 57.50%의 pass@2를 달성했으며, 이 성능은 \$0.25의 비용으로 달성되었다. 또한 연구진은 reflective orchestrator를 사용하여 이 성능을 67.25%로 개선했다.

연구진은 이 결과를 통해, abstract reasoning과 generalization을 가능하게 하는 비용 효과적인 에이전트 하네스를 개발할 수 있다는 것을 입증했다. 또한 연구진은 future 연구에 대해, broader generation을 필요로 하는지 아니면 better ranking을 필요로 하는지에 대한 falsifiable diagnostic을 제시했다.

연구진은 이 연구를 통해, abstract reasoning과 generalization을 가능하게 하는 비용 효과적인 에이전트 하네스를 개발할 수 있다는 것을 입증했다.

Explorer-Definer Pipeline

연구진은 explorer-definer pipeline을 개발했다. 이 pipeline은 pattern-discovery와 program-synthesis stages를 분리하여, 에이전트가 abstract reasoning과 generalization을 가능하게 하는데 도움이 된다.

이 pipeline은 두 가지 stage로 구성된다. 첫 번째 stage는 pattern-discovery stage이며, 두 번째 stage는 program-synthesis stage이다.

  • pattern-discovery stage: 에이전트가 abstract reasoning을 가능하게 하는데 도움이 된다.
  • program-synthesis stage: 에이전트가 generalization을 가능하게 하는데 도움이 된다.

Reflective Orchestrator

연구진은 reflective orchestrator를 개발했다. 이 orchestrator는 autonomous exploration을 가능하게 하여, 에이전트가 abstract reasoning과 generalization을 가능하게 하는데 도움이 된다.

이 orchestrator는 two-stage agent pipeline을 사용하여, 에이전트가 abstract reasoning과 generalization을 가능하게 하는데 도움이 된다.

  • two-stage agent pipeline: 에이전트가 abstract reasoning과 generalization을 가능하게 하는데 도움이 된다.

결과

연구진은 이 연구를 통해, abstract reasoning과 generalization을 가능하게 하는 비용 효과적인 에이전트 하네스를 개발할 수 있다는 것을 입증했다. 또한 연구진은 future 연구에 대해, broader generation을 필요로 하는지 아니면 better ranking을 필요로 하는지에 대한 falsifiable diagnostic을 제시했다.

연구진은 이 연구를 통해, abstract reasoning과 generalization을 가능하게 하는 비용 효과적인 에이전트 하네스를 개발할 수 있다는 것을 입증했다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 17시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.