본문으로 건너뛰기

#벤치마크

333개의 기사

에이전트 9월 10일

AutoFyn 기술 보고서: 비 парамет릭 전문가 반복을 위한 장기 시차 agent

AutoFyn은 Expert Iteration 알고리즘에 вд려서 만든 agent를 제어하는 도구입니다. AutoFyn은 대규모 언어 모델(LLM)의 가동 중인 모델을 여러 라운드 동안 업데이트하는 데 사용되는 persistent 상태를 업데이트하는 데 사용되는 verified reward signals를 사용하는 대신 모델의 가중치를 업데이트하는 방식으로 작동합니다. 각 라운드의 시작은 새

에이전트 9월 10일

기억이 도움이 될 때 : 도구 사용을 위한 LLM agent의 장기 기억에 대한 비용에 대한 평가

대규모 언어 모델(LLM) agent의 장기 기억은 오늘날 대화 기록에 대한 질문에 대한 답변을 측정하는 LoCoMo, LongMemEval과 같은 회상 성능 지표로 평가된다. 이러한 지표는 기억한 사실이 도구를 사용하는 agent의 행동을 바꾸는지 여부를 측정하지 않는다. MERIT (Memory Evaluation for Realistic Instrumented Tasks)이라는 새로운

허깅페이스 9월 7일

LLM 벤치마크는 실제로 무엇을 측정하는가?

Meta는 최근 AI를 위한 대규모 언어 모델(LLM)인 Llama 2를 발표했습니다. Llama 2는 Meta가 개발한 Llama 1 이후로 더 나은 성능과 향상된 안전성, 그리고 Meta가 사용하는 AI 시스템에 대한 더 나은 이해력을 제공합니다. Meta는 Llama 2를 위해 새로운 설계 및 훈련 방법을 개발했습니다. Llama 2는 더 많은 데이터를 처리하고 더 나은 결과를 내기 위

에이전트 9월 7일

아이리스: 검색 지평선에登문

아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티

에이전트 9월 7일

항구 어댑터와 항구 인덱스: 대규모 행위적 평가를 위한 인프라와 커스텀 메타 데이터 세트

연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench

에이전트 9월 6일

GUI 에이전트는 언제 행동하지 않아야 할까요? GUI 에이전트의 충돌 인식과 종료를 위한 새로운 접근 방법

GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.

AI 모델 9월 6일

듀플렉스 스피치 벤치-IFEval: 완전 듀플렉스 음성 대화 봇의 암묵적 지시 수행 평가

대화 중단 없이 대화하는 음성 대화 요원은 항상 듣기, 백채널, 중단, 말 오버랩 처리, 대화에 참여하기, 대화에 참여하는 것을 포기하기 등과 같은 행동을 결정해야 합니다. 현재의 벤치마크는 이러한 행동을 명시적인 대화 순서 관리 지시문을 통해 테스트하는 반면, 배치된 요원은 종종 역할이나 인격으로 구성되며, 해당 대화 행동이 추론되어야 합니다. 우리는 실시간 대화 중에서 암묵적인 지시를 따

AI 모델 9월 6일

이야기 속에 갇힌다: 다단계 LLM 대화에서 이야기 얽힘

인터넷 사용자들은 일상적인 조언을 위해 대규모 언어 모델(LLM)을 자주 사용하고 있다. 따라서 에티켓상으로는 부정적인 영향을 미치는 인적 관계 문제가 실질적인 도움을 받는 상황이 되었다. 이전 연구는 대부분 이 상황을 단일 회귀 판단이나 압박을 받은 반박으로만 연구해왔는데, 이는 실제 상황과 잘 맞지 않는다. 이러한 가정으로 인해, 단일 회귀 판단과 비교하여 다중 회귀의 도움을 받은 모델

허깅페이스 9월 4일

음성 인식 성능 최적화 측정

미국 전역에서 대규모 언어 모델(LLM) 기반의 AI 인공지능 시스템이 작동 중인 한 호텔에서 충돌이 발생했다. 23일 뉴욕 타임즈는 "AI 시스템이 호텔의 보안 시스템과 충돌하여 보안 카메라가 작동하지 않게 만든 후, 호텔 직원들은 AI 시스템을 작동시키지 않도록 시스템을 재설정했다"고 보도했다. 이 호텔은 최근에 대규모 언어 모델(LLM) 기반의 AI 시스템을 도입한 곳으로, 호텔의 AI

AI 모델 9월 3일

프론티어 언어 모델의 평가 인식 측정에 대한 벤치마크: EvalDetectBench

Frontियर급 대규모 언어 모델들은 자주 평가 중인지를 인식할 수 있으며, 이 능력을 평가 인식(evaluation awareness)이라고 한다. 만약 모델이 평가 시 다른 행동을 보인다면, 이는 평가 결과의 타당성을 침해하고, 이는 현재 AI 안전 프레임워크의 중요한 구성 요소이다. 우리는 EvalDetectBench라는 평가 인식 측정에 대한 공개 pipeline 및 벤치마크를 소개

AI 모델 8월 15일

인간과 LLM의 윤리적 판단에서 다르다: 합의는 일치가 아니다

인공지능 언어 모델(Large Language Model, LLM)과 인간의 판단이 일치하는 것은 대규모 언어 모델의 가치 지향성 평가를 위한 일반적인 대안입니다. 하지만 최종 레이블이 일치한다는 것은 인간의 주석자와 모델이 같은 도덕적 근거를 기반으로 의사결정을 내리는 것이라는 것을 보장하지는 않습니다. 두 개의_AGENT(agents)가 같은 판단을 내릴 수 있지만 서로 다른 원칙, 맥락

AI 모델 8월 15일

LLM의 연구 정직성을 평가하는 공동 연구자로서의 기초 diagnose

연구 윤리 위기 상황에서 학술 연구의 신뢰성을 유지할 수 있는지 여부는 여전히 측정되지 않은 상태에서 점점 더 많은 학문적 업무를 수행하는 대규모 언어 모델(LLM)의 사용이 증가하고 있습니다. IntegrityBench라는 새로운 벤치마크를 제시하여 연구 윤리 위반 분류, 윤리적 행동 논리 및 결과물에 근거한 결정-making을 평가하는 36개의 pair task를 3개의 영역과 4개의 연

에이전트 8월 13일

자동세계모델 벤치마크: 자율세계모델 연구를 위한 새로운 표준

세계 모델링은 현재 환경에 따라 다양한 아키텍처, 학습 목표 및 상태 표현이 상호 작용하는 복잡한 분야입니다. 이를 해결하기 위해 AI 코드 기반.agent가 자율적으로 연구할 수 있는 환경을 제공하는 새로운 벤치마크가 등장했습니다. 이 벤치마크는 8개의 게임 환경을 대상으로 하며, 고정된 컴퓨팅 비용 내에서 제공된 세계 모델링의 기초를 개선하는 것을 목표로 합니다.

에이전트 8월 12일

LLM agent가 협상할 때: 공급망에서 동적 협상과 개인 정보 보호

LLM agent가 의사결정 지원에서 자율 구매로 전환할 때, 기업은 위임된 협상자들이 가치를 창출하고 예측할 수 있게 하는지, 그리고 손실이 나는 계약을 피할 수 있는지 알 필요가 있습니다. 우리는 이 문제를 canonical supply chain bargaining 문제에서 연구했습니다: 구매자가 판매자와 quantity-payment 계약을 맺기 위해 협상을 합니다. 구매자는 판매자가

AI 모델 8월 11일

자연어를 SHACL로 번역하는 벤치마크套件

arXiv:2608.07530v1 발표 유형: 새로운 초록: SHACL은 RDF 지식 그래프(RDF KGs)의 충족성을 검증하는 핵심 기술입니다. 그러나 SHACL 형태를 만드는 것은 대부분의 전문가가 가지고 있지 않은 기술적 전문성을 요구합니다. 자연어 요구 사항을 SHACL로 번역하는 자연어 2 SHACL(NL2SHACL)는 이 장벽을 낮출 수 있습니다. 그러나 NL2SHACL에 대한 전

LLM PC 8월 10일

중간 층의 주의 집중 예측을 통해 시각 토큰 압축

대규모 멀티모달 언어 모델(Multimodal Large Language Model, MLLM)의 효율성을 향상시키기 위해 시각 토큰 압축을 사용하는 방법을 제안합니다. 이 방법은 중간 언어 모델 층의 주의 집중을 예측하여 시각 토큰의 중요도를 평가합니다. 이 방법은 existing inference acceleration techniques와 호환되며, 10개의 benchmark에서 97.5%의 unpruned model 성능을 유지하며, 5.56%의 시각 토큰만 사용하여 3.09배의 end-to-end speedup을 달성합니다.

에이전트 8월 7일

장기 시각의 검색-agent에서 실패를 감사하고 책임지기 위한 SearchAuditor

대규모 언어 모델(LLM) 검열 장치가 장기적인 웹 상호작용을 통해 어려운 질문에 대해 대응하는 것은 복잡하고 취약한 과정이지만, 작은 추론 오류가 장기적인 노이즈 트레이저지로 퍼져서 유창하지만 오류 있는 대답으로 이어질 수 있다. 이러한 실패를 진단하는 것은 어렵고, 인간이 수집할 수 있는 매우 긴 실행 추적을 수동으로 검토해야 하는데, 이는 인간의 능력 범위 이상이다. 그러므로 우리는 S

에이전트 8월 7일

추상 사건 원인 규칙: 유추와 적용

Event 중심의 지능적인 분석 시스템은 위험 경보, 의사 결정 지원 및 논리 이해를 위해 명시적 원인-효과 이벤트 지식에 의존한다. 그러나 기존의 인스턴스 수준 원인 pairs는 저빈도 장골 및 미래에 발생할 수 있는 이벤트 combinations에서 심각한 일반화 결함을 겪고 있다. 이러한 한계를 해결하기 위해 본 연구에서는 Abstract Event Causal Rule (AECR)이라

AI 모델 8월 6일

적대적 강도에 대한 추론적 결합: 사전 학습된 트랜스포머 기반 인식 모델

대규모 언어 모델(LLM)과 같은 이전에 훈련된 인식 모델을 새로운 환경에서 사용하면 분포가 변화하는 경우 정확도가 저하되며 단독으로 이를 회복시키려면 결합 방식을 사용하는 것만으로는 충분하지 않다. 결합 방식 중 다수결 투표는 재콜을 위해 정밀도를 희생하고 coordinated 실패에 취약하다. 이전의 메타인지 방법은 논리적 규칙을 통해 모델의 오류를 식별하지만, 실제로 새로운 장면에 적용

에이전트 8월 6일

대상적인 EEG 이해를 위한 큰 언어 모델의 성능 평가

전자뇌파 분석(Electroencephalography, EEG)은 단순히 녹음파일에 레이블을 할당하는 것 이상으로, 자연어 명령, 신호처리, 양적 증거, 과학적 해석과 연결된 워크플로우가 필요하다. 이를 우리는 \emph{전체적인 EEG 이해}라고 부른다. 그러나 현재 평가는 주로 단일 분리적 인코딩 작업이나 시스템에 특화된 데모에 초점을 맞추고 있으므로, 대규모 언어 모델(LLMs)의 c

인기 태그