빠른 모델, 느린 증거: System-1 결정 모델의 pair 및 self-audited 평가
대규모 언어 모델(LLM) agent harnesses는 작은 sized, typed 의사결정을 여러 번 수행합니다. System-1 결정 모델은 이러한 질문에 대해 한 번의 전방 패스에서 클래스 확률을 사용하여 대규모 비용과 지연 시간을 절약할 수 있는 약속을 합니다. 우리는 11개의 agent 결정 점을 빌드하여 18개의 공개 자원에서 pair evaluation을 수행하였습니다.
대규모 언어 모델(LLM) agent harnesses는 작은 sized, typed 의사결정을 여러 번 수행합니다. 이러한 결정에는 모델을 호출하는 것, 도구를 사용하는 것, 검색된 텍스트가 관련성이 있는지 여부, 입력이 주입이 있는지 여부와 같은 것들이 포함됩니다. System-1 결정 모델은 이러한 질문에 대해 한 번의 전방 패스에서 클래스 확률을 사용하여 대규모 비용과 지연 시간을 절약할 수 있는 약속을 합니다.
우리는 open-weight (Laya)와 hosted (Jev) System-1 모델의 pair evaluation을 수행하였습니다. 11개의 agent 결정 점을 빌드하여 18개의 공개 자원에서 7,283개의 base case와 6,640개의 robustness variant를 사용하였습니다. pair tests와 cross-hardware와 cross-day reproducibility checks를 수행하였습니다.
결과적으로, Jev는 9개의 11개의 결정 점에서 Laya보다 정확도가 높았습니다. (+10.8 to +46.0 pp). 하지만, 두 모델 모두 zero-shot model routing에서 chance를 넘지 못하였고, RAG relevance gating에서는 동등한 결과를 나타났습니다.
또한, 우리는 우리 자신의 pipeline을 ауд이트하였습니다. 세 가지 분석 오류와 하나의 설계 오류가 헤드라인 배포 선언을 왜곡하였습니다. omitted pre-screen cost, gate accuracy가 end-to-end quality로 보고되었으며, in-sample thresholds와
함께 읽으면 좋은 기사
AI가 모든 것을 바꾸는 시대, EmTech Future 2026
AI는 생물학, 인프라, 제조, 과학을 바꾸고 있다. AI가 다른 분야와 교차할 때 가장 큰 영향을 미칠 수 있는 이유를 알아보자. AI가 모든 것을 바꾸는 시대를 경험해 보자.
카라트: 재료 LLM은 추론하거나 암송합니까?
물리학적 물질의 대규모 언어 모델(LLM)이 결정 구조에 대한 질문에 대해 대답할 때, 그것은 구조에서 논리를 풀어내거나 이미 입력으로 들어온 답을 그대로 복사하는지 알기 어렵다. 정확도는 구조 설명이 평가하는 항목 자체를 출력하는 경우가 많기 때문이다. CARAT는 여덟 개의 일치된 시각에서 질문과 정답을 고정하고, GraphSpace에서 구조적 관계를 따로 이름을 붙이고, 일치된 튜닝,
GPT-6.1 솔루션 소개
GPT-6.1 Sol은 Astra의 표준 API 입력 및 출력 토큰 가격의 5분의 1에 대해 코딩, 컴퓨터 사용 및 전문 업무를 위한 근접한 Astra 인텔리전스를 제공합니다.
LLM의 효과적인 미세 조정에는 인간이 읽을 수 있는 텍스트가 꼭 필요한가?
인간이 읽을 수 있는 텍스트 형태가 큰 언어 모델의 효과적인 미세 조정에 꼭 필요한지 알아보기 위해 연구를 진행했습니다. 모델에 따라서 훈련을 진행하는 표현을 보존하거나 향상시키기 위해 인간이 읽을 수 있는 텍스트 형태가 필요할까요? 우리는 Desired-Update-Aligned Synthetic Data (DASA)라는 개념을 제안했습니다. DASA는 [대규모 언어 모델](large la
설명 가능한 인공지능 방법론의 평가를 위한 합성 지표 프레임워크
인공지능(AI) 해석 가능성 평가 방법(XAI)의 평가 task는 신뢰할 수 있는 평가 절차의 부족과 특히 ground truth 설명의 부재로 어려운 일이다. 문헌에서 기존의 평가 방법은 기존의 블랙 박스 모델의 예측과 설명의忠실성 측정으로 설명을 평가한다. 그러나 이러한 평가 전략은 설명이 모델의 출력을 재생산하는 정도를 측정하는 것으로 제한되며, 설명이 모델의 내부 결정 과정에 대한 올
미소프트가 퀄컴의 X2 플러스 칩을 탑재한 더 작은 서피스 프로와 랩톱을 새로 출시합니다.
마이크로소프트는 퀄컴의 최신 스냅드龍 X2 플러스 칩을 사용하여 Surface Pro 12인치와 Surface Laptop 13인치를 업데이트한다. 작은 Surface 기기는 이전 해와 같은 디자인과 하드웨어 기능을 유지하며 내부에 더 빠르고 강력한 칩을 탑재하고 가격도 더 높아졌다(램 가격 상승으로 인해!). 12인치 Surface Pro는 $799.99에서 시작했지만(…)
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.