본문으로 건너뛰기

아이리스: 검색 지평선에登문

아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티

AI 자동 생성

새로운 검색 지평선

최근에 발표된 연구에서, 두 가지 새로운 검색 에이전트인 Iris-mini와 Iris-pro가 소개되었습니다. 이 에이전트들은 대규모 언어 모델(LLM)인 35B-A3B와 397B-A17B 스케일에서 훈련되었으며, 데이터 파이프라인과 훈련 레시피가 함께 제시되었습니다. 이러한 에이전트들은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 시드 페이지와 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티를 설명적 참조로 재작성하여 문자열 매칭으로는 암호를 풀 수 없는 상태로 유지합니다.

이러한 질문은 트래젝토리 형태로 변환되며, SFT 이전에 트래젝토리와 턴 단위로 필터링됩니다. 정책은 강화 학습(RL)을 통해 라이브 검색과 대결하며, 보상 판정자와 관찰 요약자는 훈련 클러스터 내부에 위치하며, 오버 롤아웃은 요청 단위로 중단되어 prefix가 커밋된 다음 단계에서 재개됩니다. 이러한 프로세스는 SFT-RL 클라이밍 과정에서 두 단계를 교대로 반복하며, 각 RL 라운드에서 가장 어려운 문제와 가장 효율적인 롤아웃만 다음 감독 패스로 반환합니다.

성능 평가

이 벤치마크에서 추론 시간 컨텍스트 관리는 일반적인 시스템 간의 대부분의 차이보다 더 가치가 높기 때문에, 모든 벤치마크를 관리가 활성화된 상태와 비활성화된 상태에서 평가합니다. 관리 활성화 시, BrowseComp, BrowseComp-ZH, DeepSearchQA, HLE 벤치마크에서 두 모델은 각각 82.2/84.8/86.9/52.3, 88.6/85.1/92.9/56.4 점을 기록하며, 오픈소스 검색 에이전트들 중 파라미터 범위에 따라 가장 강력한 결과를 달성했습니다. 모델 가중치와 데이터 생성, 훈련, 평가에 관한 완전한 레시피를 함께 공개할 계획입니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 17시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.