본문으로 건너뛰기

구조화된 agent 평가 및 근거付け

대규모 언어 모델(LLM)의 에이전트 호출 평가에서 정확도만을 고려하는 것은 다양한 실패 모드의 차이를 가려버린다. 모델이 올바른 함수를 선택했더라도 인자 값을 허구로 만들거나, 스키마를 만족하면서도 잘못된 이유로 에이전트를 선택할 수 있다. 기존 벤치마크는 이러한 차이를 단일 이진 점수로 압축하기 때문에, 실무자들은 에이전트 호출이 실패하는 곳을 진단할 수 없다. 우리는 SAAG이라는 연쇄

AI 자동 생성

에이전트 호출 평가의 한계

대규모 언어 모델(LLM)의 에이전트 호출 평가에서 정확도만을 고려하는 것은 다양한 실패 모드의 차이를 가려버린다. 모델이 올바른 함수를 선택했더라도 인자 값을 허구로 만들거나, 스키마를 만족하면서도 잘못된 이유로 에이전트를 선택할 수 있다. 이러한 문제는 기존 벤치마크가 이러한 차이를 단일 이진 점수로 압축하기 때문에, 실무자들은 에이전트 호출이 실패하는 곳을 진단할 수 없다. 에이전트 호출 평가의 한계를 극복하기 위해, 우리는 SAAG이라는 연쇄적인 진단 프레임워크를 제안한다. 이 프레임워크는 에이전트 호출 평가를 세 가지 연속적인 단계로 분할한다: 레지스트리 동형성, 구조적 완전성, 인자 고정. 각 단계는 해석 가능한 단계별 진단을 생성한다. 이 진단은 또한 반복적인 자기 수정을 가능하게 한다: 예측 실패 시 단계별 신호가 특정한 수정을 지시하면서, 실제 값을 유출하지 않는다.

SAAG 프레임워크의 평가

우리는 레지스트리 크기가 5, 10, 15 에이전트인 데이터셋을 기반으로 제어된 벤치마크에서 SAAG 프레임워크를 평가한다. 구조화된 피드백은 단일 패스 인페런스와 비유사적인 이진 피드백보다 인자 정밀도 향상과 값 허구 감소를 일관되게 제공한다. 그러나 종단 간 F1 점수 향상은 모델 종류와 레지스트리 크기에 따라 다양하다. 이 결과는 다양한 모델 종류와 레지스트리 크기에서 에이전트 호출 신뢰성 향상을 위한 단계 분할 진단 평가의 필요성을 제안한다. 이러한 연구 결과는 대규모 언어 모델(LLM)의 에이전트 호출 평가를 더 정확하고 신뢰성 있게 수행하는 데 도움이 될 수 있다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 17시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.