본문으로 건너뛰기

행동하기 전에 선택하기: 장기적인 도구 사용 요소에 대한 상대적 가치 추정

AI 자동 생성

대규모 언어 모델(LLM)은 복잡한 작업을 수행할 때 장거리 도구 호출 시퀀스에 의존하는데, 각 호출은 작업 상태를 변경하고 다음 결정에 영향을 줄 수 있다. 장거리 도구 사용 시, 최종 결과 보상을 통해 장기적인 상호 작용 트레이스에 대한 약한 신뢰할 수 있는 할당이 제공되지만, 단계별 보상은 더 표적화된 피드백을 제공할 수 있다. 그러나 신뢰할 수 있는 단계별 감독을 얻기 위해 종종 인간 또는 LLM 판단이 필요하거나, 추가 롤아웃을 통해 중간 결정의 하류 효과를 추정해야 한다. 이 논문에서는 효과적인 도구 사용_AGENT가 실제로 수행되지 않은 다음 도구 호출의 장거리 가치를 추정하기 전에 실행하기 전에 해야 할 목표를 주장한다. 이 목표는 동일한 맥락에서 대안 호출에 대한 비교 감독이 필요하다. 그러나 로그드 트레이스에는 실제로 취한 호출만 포함되어 있기 때문에. 따라서, 우리는 비교적 도구 사용_AGENT(CITA) 제안한다. CITA는 관찰된 도구 행동, 스케일러블 감독을 제공하는 bayesian 도구 그래프 시뮬레이터 및 LLM 기반 비교의 의미적 판단을 결합한 paired 신호에서 Comparative Inference Model(CIM)을 학습시킨다. CIM은 현재 맥락에서 최종 작업 성공을 지원하는 다음 도구 호출의 가능성을 얼마나 높이는지 학습한다. 세 가지 도구 사용 벤치마크와 여러 백본 LLM에서 CITA는 도구 F1 및 작업 성공을 지속적으로 향상시켰다. 추가 분석은 CIM이 비교적 도구 선택의 단계별 가치 추정에 정확한 가치를 학습한다는 것을 보여준다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 58분 전

텍스트를 이미지로 전환하는 확산 모델에서 만족도-다양성 경계를 넘나들다.

텍스트-이미지 생성은 사용자가 같은 프롬프트에서 생성된 여러 이미지를 탐색할 수 있도록 한다. 이러한 생성된 이미지가 유용하려면, 사용자가 선호하는 것을 측정하는 학습된 보상에 따라 각 이미지가 반영되어야 하며, 다른 이미지를 유지하기 위해 시각적으로 다른 모습을 보여야 한다. 기존의 방법은 한계가 있다: 보상과 다양성을 따로 다루거나, 그들을 한 개의 집계 점수로 결합하여, 보상이 낮은 것

AI 모델 59분 전

AI 위험 관측소: 기업의 AI 반응에 대한Disclosure를 통해 사회적 탄력성에 대한 새로운 시각을 얻을 수 있을까?

기업의 AI 위험에 대한 Disclosure를 분석하여 사회적 탄력성에 대한 새로운 시각을 얻을 수 있을까? 연구팀은 대규모 언어 모델(LLM)을 사용하여 1,362개 영국 상장기업의 9,821개 연간 보고서를 분석한 결과, 2020년부터 2025년까지 AI 위험 Disclosure가 2.8%에서 41.2%로 크게 증가했다고 밝혔다.

AI 모델 12시간 전

인공지능이 스타크래프트에서 인간을 이기지 못하니 기계적으로 승리하기로 결심했다

스타 스킘르미시(StarSkirmish)는 인공지능(AI)으로 만든 스타크래프트(StarCraft) 플레이 봇을 서로 대결시키고, 인간이 만든 봇과도 대결시키는 시스템입니다. 오픈아이(OpenAI)의 GPT-6 아스트라(Astra)와 클로드 오푸스 5.5(Claude Opus 5.5)는 거의 동등한 성능을 보였지만, 스타 듀스트(Stardust)라는 인간이 만든 봇을 상대로는 뒤질 수 없는

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.