본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 5월 23일

머신 러닝 모델의 설명 가능성을 위한 인과 논증 방법

기계 학습 모델의 설명성에 대한 원인적 논증 방법 arXiv:2605.21758v1 발표 유형 : 새로운 추론 : 설명 가능한 AI (XAI) 방법은 모델의 예측에 관련된 특징을 식별하지만 종종 특정 결정을 내리는 이유를 명확히하지 못합니다. 이 작품에서는 원인성과 논쟁 기반 논증을 통합하여 모델이 예측을 할 수있는 이유를 설명하는 새로운 방법을 제시합니다. 우리의 접근 방식은 원인 발견 방법을 사용하여 변수 간의 원인 관계를 먼저 식별하고 결과를 양극적 논증 프레임 워크 (Bipolar Argu

에이전트 5월 23일

SMDD-벤치 : LLM은 실제 작은 분자 약물 디자인 작업을 해결할 수 있습니까?

SMDD-벤치: LLM은 실제 세계의 소분자 약물 디자인 과제를 해결할 수 있습니까? arXiv:2605.21740v1 발표 유형 : 새로운 포스트 : LLM 에이전트는 과학적 발견 응용 프로그램에 대한 놀라운 잠재력을 가지고 있습니다. 그러나 실제 세계의 소분자 약물 디자인 (SMDD) 과제에 대한 LLM 에이전트의 성능은 분명하지 않습니다. 현재의 평가 방법은 ad hoc, 현실 세계의 발견에 너무 간단하고 규모가 제한되거나 단일 회전 질문 응답에 제한됩니다. SMDD-벤치 (SMDD) 과제

AI 모델 5월 23일

AttuneBench : LLM 감정 지능을위한 대화 기반 벤치마크

이러한 대화 capuneBench: 대화 기반 컨텍스트를 직접 예측하는 행동: LLM 감정적 인 지능 프레임 워크에 대한 통합 기반 벤치마크 arXiv:2605.21739v1 발표 유형 : 새로운 추론 : 감정적 인 지능 (EI), 다른 사람의 감정적 인 상태에 적절하게 인식, 이해 및 응답 할 수있는 능력은 인간의 의사 소통의 중심이며 LLM이 일상 생활에서 대화 역할을 수행함으로써 점점 더 중요합니다. 기존 EI 벤치마크는 합성 프롬프트, 단일 회로 행동 사례 또는 특정 제 3 자 항목에 의존

LLM PC 5월 23일

TO-Agents: 선호도 가이드 토폴로지 최적화를 위한 멀티 에이전트 AI 파이프라인

TO-Agent Selector: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization arXiv:2605.21622v1 이러한 효과적인 발표 유형 : 새로운 추론 : 메모리 최적화는 효율적인 피드백을 생성 할 수 있지만 디자이너는 종종 원하는 시각적 스타일, 제품 경험 또는 파이프터 최적화 설정을 원하는 파이프터 설정으로 수동으로 번역해야합니다. 우리는 TO-Agents, 천연 언어 설계 의도를 iterative topolo

AI 모델 5월 23일

LLMs에서 분포 외 정렬 실패를 위한 모니터 벤치마크 및 개선에 대한 리뷰 보기

벤치마킹 및 대형 언어 모델 (LLMs)의 보안 및 조정 실패를 개선하는 모니터는 LLMs arXiv:2605.21602v1에서 배포 외부 조정 실패에 대한 특이한 벤치마킹 또는 응답 패턴입니다.이 발표 작업 유형 : 새로운 추론 : 대형 언어 모델 (LLMs)의 많은 보안 및 조정 실패는 배포 외부 (OOD) 상황 때문에 발생합니다 : 모델 개발자가 예측하지 못한 특이한 벤치마킹 또는 응답 패턴. 우리는 시스템적으로 LLM 모니터링 파이프라인이 우리의 자신의 모니터를 훈련하는 데 사용할 수 있는

에이전트 5월 22일

선언적 데이터 서비스: 데이터 시스템 구성 위한 구조화된 에이전트 발견 리뷰 보기

오류 보고서 데이터 서비스 : 구성 데이터 시스템을 구성하기위한 구조화 된 에이전트 데이터 프레임 탐색 arXiv:2605.20690v1 광고 유형 : 새로운 추론 : 에이전트 연구는 LLM 기반 검색이 벤치마크 조건 하에서 새로운 알고리즘, 디자인 및 코드를 찾을 수 있음을 보여주었습니다. 패러다임을 멀티 시스템 데이터 백엔드에 번역하는 것은 더 어려운 문제를 야기합니다 : 검색 공간은 heterogeneous이며, 검사자는 배포 된 스택이 실제로 실행되는지 여부이며, 구성 지식은 사전 훈련에서

에이전트 5월 22일

AgentAtlas : LLM 에이전트를위한 결과 리더보드 이상

에이전트 Remlas : LLM 에이전트에 대한 단일 닫힌 도구 리더보드 arXiv:2605.20530v1 고정 유형 발표 : 새로운 추론 : 대형 언어 모델 에이전트는 이제 코드베이스, 브라우저, 운영 체제, 달력, 파일 및 도구 생태계에 작용하지만, 그들을 평가하는 데 사용 된 벤치마크는 더 이상 분할되지 않습니다 : 각각 측정의 다른 유닛을 강조합니다 (마지막 작업 성공, 도구 호출 유효성, 반복 트래픽 일관성54, 경로 보안, 또는 공격 강도). 2024-2025 작업의 라인은 단일 정확도

에이전트 5월 22일

국경 AI 능력을 측정하기위한 오픈 월드 평가

프랜차이즈 인공지능 능력을 측정하기 위한 오픈 월드 평가 arXiv:2605.20520v1 발표 유형: 새로운 추론: 벤치마크 기반 평가는 프랜차이즈 인공지능 진전을 추적하기 위해 중요하다. 그러나 그것은 정확하게 지정, 자동적으로 등급, 최적화하기 쉽고 낮은 예산과 짧은 시간 경계로 실행할 수있는 작업을 우선시할 수 있기 때문에 배포 된 능력을 과도하고 과도 할 수 있습니다. 이 논문에서 우리는 최근의 오픈 월드 평가를 조사하고, 그들의 강점과 한계를 식별하고, CRUX (오픈 월드 업데이트를위

에이전트 5월 22일

AgentCo-op: 상호 운용 가능한 다중 에이전트 워크플로우의 검색 기반 합성에 대한 리뷰 보기

AgentCo-op: 상호운용성이 가능한 다중 에이전트 워크플로우의 검색 기반 합성 리뷰 보기 AgentCo-op: 상호운용성이 가능한 다중 에이전트 워크플로우의 검색 기반 데이터 합성 arXiv:2605.20425v1 알림 유형: 신규 초록: AgentCo-op 기반 워크플로우 설계는 특히 교육용 데이터 세트가 없고, 신뢰할 수 있는 스칼라 평가 지표가 없으며, 기존 도구와 에이전트 간에 표준화된 인터페이스가 없는 개방형 과학 환경에서 특히 어렵습니다. 우리는 AgentCo-op를 제안합니다.

에이전트 5월 22일

OSCToM: 높은 수준의 이론적 사고를 위한 강화 학습 기반 적대적 생성에 관한 연구

OSCToM: RL-Guided Data Efficient Adversarial Generation for High-Order Theory of Mind arXiv:2605.20423v1 Announce Type: New Abstract: Large Language Models (LLMs)는 많은 언어 작업에서 잘 수행하지만, 그들의 마음의 이론 (ToM) 논리는 여전히 복잡한 사회 환경에서 불균형합니다. ExploreToM을 포함한 기존 벤치마크는 항상 이러한 설정을 어렵게 만드는 회귀 신념과

에이전트 5월 20일

POLAR-Bench: 프라이버시-유틸리티 트레이드오프를 위한 LLM 에이전트의 진단 벤치마크

POLAR-Bench: 프라이버시-유틸리티 트레이드오프를 위한 대규모 언어 모델(LLM) 에이전트의 진단 벤치마크 대규모 언어 모델(LLM) 에이전트는 점점 더 사용자의 개인 정보에 접근하고 사용자의 대리인으로서 세 번째 당사자 시스템과 상호 작용할 때 사용자의 의도에 따라 행동한다. 사용자는 공유할 수 있는 것과 공유하지 말아야 하는 것을 정의하고 에이전트는 세 번째 당사자 시스템이 적대적으로 행동하는 경우에도 그 의도를 강력하게 따르도록 해야 한다. POLAR-Bench(정책에 의한 적대

에이전트 5월 20일

긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크: DecisionBench

DecisionBench는 긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크이다. DecisionBench는 작업 집합(GAIA, tau-bench, BFCL multi-turn), 동료 모델 풀(11 모델, 7 벤더 가족), 위임 인터페이스(call_model와 읽기 프로파일 채널의 옵션), 결정론적 스킬-ANNOTATION 레이어, 품질, 비용, 지연 시간, 위임률, 라우팅 신뢰도-at-k, 벤더 자체 선호도, 그리고 카운터팩토럴 위임 천장으로 구성된 다중 축 메트릭 스위트를 포함

AI 모델 5월 20일

시스템 프롬프트 최적화에 대한 연구: 동적 표현을 통한 베이즈 최적화

시스템 프롬프트는 현대 AI 시스템의 중심 제어 메커니즘으로, 대화, 작업 및 사용자 인구를 통한 행동을 형성합니다. 그러나 피드백이 예시별 레이블, 오류 또는 비판이 아닌 집계 메트릭으로만 제공되는 경우 프롬프트를 조정하는 것이 어렵습니다. 본 연구에서는 집계 피드백 설정을 단순화된 블랙박스 최적화로 연구합니다. 이 연구에서는 ReElicit, 베이즈 최적화 프레임워크를 소개합니다. ReElicit는 대규모 언어 모델(LLM)을 사용하여 compact하고 해석 가능한 특성 공간을 유도하고 프롬프트를 이 특성 공간으로 매핑합니다. 확률적 가우시안 프로세스 서브레이트를 사용하여 수집된 프롬프트 점수를 기반으로 acquisition 함수는 목표 특성 벡터를 선택하고 LLM은 이를 구현하고 최적화하여 배포 가능한 시스템 프롬프트로 만듭니다. 새로운 평가가 도착할 때마다 특성 공간을 재엘리시트하여 관찰된 프롬프트-점수 역사에 따라 표현을 적응시키는 것이 가능합니다.

에이전트 5월 20일

대화형 자연어 질문을 SQL로 변환하는 일반 용도 에이전트: AgentNLQ

대화형 자연어를 SQL로 변환하는 문제는 연구자와 기업에게 중요한 문제로, 관계형 데이터베이스가 광범위한 실용적인 문제에 중요한 역할을 하기 때문이다. 대규모 언어 모델(LLM)의 능력 향상에도 불구하고, 대화형 자연어를 SQL로 변환하는 문제는 인간 전문가 SQL 작가와의 정확도 면에서 여전히 열린 문제로, 추가적인 개선이 필요하다. 이 연구에서는 대화형 자연어를 SQL로 변환하는 새로운 다중 에이전트 방법을 제시한다. 이 방법은 78.1%의 의미적 정확도를 달성하는 BIg Bench for LaRge-scale Database (BIRD) 벤치마크에 대해 평가되었다. 이 연구의 주요 기여는 다음과 같다: (a) 다중 에이전트 솔루션에서 최적화된 새로운 오케스트레이터를 설계하여 LLM을 사용하여 계획, 오케스트레이션, 반영, 자체 교정하여 정확한 SQL 쿼리를 생성한다. (b) 고급 스키마 enrichment 방법을 개발하여 정확성을 향상시키기 위해 계층 구조 메타데이터를 생성한다. (c) BIRD-SQL 벤치마크에서 다중 도메인과 데이터셋에 대한 정확성과 일반화성을 평가하여 정확성과 일반화성을 보여준다.

AI 모델 5월 20일

문서 AI를 운영화하는 방법: OCR 및 LLM 파이프라인을 프로덕션에서 운영하는 마이크로서비스 아키텍처

문서 이해를 위한 새로운 모델을 연구하는 학술 연구는 모델 정의와 프로덕션 규모에서 모델을 실행하는 격차를 메우기 위해 마이크로서비스 아키텍처를 제시합니다. 이 아키텍처는 분류, OCR, 대규모 언어 모델(structured field extraction) 파이프라인을 포함합니다. 이 아키텍처를 프로덕션에서 운영하면서 우리의 경험을 공유합니다.

AI 모델 5월 19일

대규모 언어 모델의 선형 대수 산술 오류를 드러내는 법과학적 벤치마크: LinAlg-Bench

대규모 언어 모델의 선형 대수 산술 오류를 평가하기 위한 새로운 벤치마크를 소개합니다. 이 벤치마크는 3x3, 4x4, 5x5 행렬에 대한 10개의 대규모 언어 모델을 평가하고, 9개의 과제 유형과 660개의 SymPy-인증 문제를 포함합니다. 벤치마크는 6,600개의 모델 출력을 평가하고, 1,156개의 오류를 분류하여 LLM의 산술 오류가 무작위적이지 않고 구조적으로 제약된다는 것을 밝혀냈습니다.

AI 모델 5월 19일

TTE-Flash: Chain-of-Thought를 통해 멀티모달 표현을 가속화하는 '생각-그후-임베딩 토큰'

연구진은 Chain-of-Thought(CoT) 논리를 통해 Universal Multimodal Embedding(UME)의 성능을 크게 향상시켰다. 하지만 CoT를 생성하는 데 필요한 컴퓨팅 자원은 종종 부담이 된다. 연구진은 CoT를 생성하는 대신 latent think 토큰을 사용하여 CoT를 생성하는 것을 방지한다. 이 연구에서는 think 토큰과 임베딩 토큰을 추출하는 방법과 think 토큰과 임베딩 토큰을 학습하는 방법에 대한 두 가지 주요 아키텍처 디자인을 조사한다.

AI 모델 5월 18일

대규모 언어 모델이 목표 인식에 쓸모있는가?

대규모 언어 모델(LLM)은 최근에 잘 알려진 계획 도메인에서 고전 계획자와 거의 동등한 수준으로 성능을 보여주었지만, 이 compétence은 세계 지식을 이용하는 것에instead 의แท로 상징적인 사유에 기초한 것이 아니다. 목표 인식은 LLM의 강점에 더 적합한 추론 과제이다. LLM의 세계 지식과 일치하는 것을 평가하는 것에만 의존한다. 이 연구는 LLM을 목표 인식자로 사용하는 처음으로 체계적인 zero-shot 평가를 제공한다. 본 연구의 결과는 LLM의 목표 인식 능력이 불균일한 것으로 나타났다. 일부 모델은 증거에 따라 성능을 개선하고 전체 관찰 시 랜드마크 기반 정확도에 접근하는 반면, 다른 모델은 증거가 쌓일수록 세계 지식의 전제에 고정되어 있다. 모델의 추론 경로를 통해 유의미한 차이를 발견한 결과, 이 차이는 증거 통합 차이로 인한 것이 아니라 도메인 친숙성 차이로 인한 것이 아니다. 이러한 결과는 LLM의 기본 계획 지식에 대한 일원적인 벤치마크로 목표 인식의 중요성을 강조한다.

인기 태그