본문으로 건너뛰기

#벤치마크

333개의 기사

연구 4월 27일

수학적 사고가 출현하는지 테스트하는 '수학이 두 번 필요하다'

대규모 언어 모델(LLM)은 수학적 벤치마크에서 놀라운 능력을 보여주지만, 이는 실제 수학적 사고인가 아니면 통계적 패턴 매칭인가에 대한 의문이 남아있다. 기존의 평가 방법은 기존 수학적 관습에 기반한 기호 문제에만 의존하여, 모델의 추상 개념을 첫 번째 원칙에서부터 구축할 수 있는 능력을 파악하기 어렵다. 이 연구에서는 '수학이 두 번 필요하다'라는 새로운 벤치마크를 제안하여, 통신을 통해 수학적 사고가 출현하는지 테스트한다. 인간의 수학적 인식이 정교한 통신의 필요성과 함께 진화했을 것이라는 가설에 의해 мот이브 되며, 두 대상을 포함하여, 이전에 수학적 지식이 없던 두 대원이 시각적으로 기반한 작업을 해결하는 데 수학적 언어를 사용하는 데 도움이 되는 수학적 시스템을 발견할 수 있는지 테스트한다. 기존의 데이터셋과는 달리, 우리의 벤치마크는 미리 정의된 수학적 언어를 배제하고 대신에, 이전에 발견하지 못한 구조와 표현을 발견할 수 있도록 한다. '수학이 두 번 필요하다'는 수학적 사고가 출현하는지 테스트하는 새로운 방법을 제공하여, 대규모 언어 모델(LLM)이나 다른 모델의 수학적 사고 능력을 개발하고 평가하는 데 도움이 될 것이다.

AI 모델 4월 23일

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법 임상시험에서는 약물 사용 프로토콜에 엄격히 따르지만 투여 오류는 여전히 환자 안전과 시험의完整성을影响하는 지속적인 도전으로 남아있다. 우리는 gradient boosting을 사용하여 comprehensive multi-modal feature engineering을 통한 unstructured clinical trial narratives에서 dosing errors를 자동 감지하는 시스템을

AI 모델 4월 23일

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA 열역학 문제 293개를 3개 층으로 나누어 정의합니다: 속성 검색(110 Q), 구성 요소 분석(101 Q), 및 전체 사이클 분석(82 Q). CoolProp 7.2.0을 사용하여 물, R-134a, 및 변이 cp 공기를 다루는 그라운드 트루스는 프로그래밍적으로 계산됩니다. 여섯 대의 정교한 LLM은 각각 세 번의 독립적인 실행을 통해 평가됩니다. 합성 리더보드는 Claude Opus 4.6 (94.1%), GPT-5

AI 모델 4월 23일

AML 추계에 대한 설명 가능한 LLM 접근: 증거 검색 및 대체사례 검증

AML 추계는 대규모 언어 모델(LLM)을 이용하여 다양한 증거를 요약하고 합리화를 작성할 수 있지만, 규제된 워크플로우에서 무제한적 생성은 허구, 약한 증거, 그리고 내재된 결정에 대한 충실하지 않은 설명을 유발할 수 있다. 본 연구에서는 AML 추계를 증거 제한된 결정 과정으로 다루는 설명 가능한 AML 추계 프레임워크를 제안한다. 본 연구에서는 (i) 정책/유형 지침, 고객 맥락, 경보 트리거, 거래 서브그래프에서 증거를 추출하는 검색-augmented 증거 집합, (ii) 명시적인 인용과 지원하는 것과 반대하거나 누락된 증거를 구분하는 구조화된 LLM 출력 계약, (iii) 최소한의可能性가 있는 변동이 추계 추천과 합리화에 대한 일관된 변화를 유발하는지 검증하는 대체사례 검증을 포함한다. 본 연구에서는 공공의 합성 AML 벤치마크 및 시뮬레이터에서 평가하고 규칙, 표자 및 그래프 기반 머신러닝, LLM-only/RAG-only 변형과 비교한다. 결과는 증거 기반으로 하기 때문에 감사 가능성이 크게 향상되고 숫자 및 정책 허구 오류가 감소한다는 것을 보여주며, 대체사례 검증 또한 결정과 관련된 설명 가능성과 내구성이 더 크게 향상한다. 이 결과는 AML 추계에 대한 규제 요구 사항에 대한 충เทคโนโลย을 제공하는 지배가 가능한, 검증 가능한 LLM 시스템이 실용적인 결정 지원을 제공할 수 있음을 나타낸다.

AI 모델 4월 22일

사회적 지능을 가르치는 새로운 AI 기술, SAVOIR

사회적 지능은 언어 에이전트가 복잡한 사회적 상호 작용을 navegate 할 수 있는 능력입니다. 이번 연구에서는 SAVOIR framework을 제안하여, 협력 게임 이론을 기반으로 한 새로운 사회적 지능을 가르치는 방법을 제안합니다. 이 framework은 기존의 접근법과 달리, 다중 턴 대화 결과에 대한 기여도를 결정하는 문제를 해결합니다.

AI 모델 4월 22일

데이터 웨어하우스 그래프 상계구성력 평가를 위한 새로운 벤치마크: DW-Bench

연구팀은 데이터 웨어하우스 그래프 상계구성력 평가를 위한 새로운 벤치마크인 DW-Bench를 소개합니다. 이 벤치마크는 대규모 언어 모델(LLM)의 그래프 상계구성력 평가를 위해 설계되었으며, 데이터 웨어하우스 스키마의 외래키(FK)와 데이터 선계(edge)를 통합합니다. 연구 결과, 도구를 활용한 방법이 정적 접근 방식보다 훨씬 더 좋지만, 어려운 합성적 하위 유형에서는 성능이 plateu합니다.

에이전트 4월 22일

자동화 벤치마크: 비즈니스 워크플로우를 위한 AI 에이전트 평가

자동화 벤치마크는 AI 에이전트가 REST API를 통해 크로스 애플리케이션 워크플로우를 조정하는 능력을 평가하기 위한 새로운 벤치마크입니다. 이 벤치마크는 실제 비즈니스 워크플로우를 기반으로 만들어졌으며, 에이전트가 필요한 엔드포인트를 발견하고, 정책을 따르고, 각 시스템에 올바른 데이터를 기록하는 능력을 평가합니다.

AI 모델 4월 22일

자연어에서 실행가능한 나르세스: 나스(NARS) 논리 reasoning 시스템을 위한 새로운 심볼릭 벤치마크 및 파이프라인

대규모 언어 모델(LLM)은 언어 생성에 뛰어나지만, 명시적 심볼릭 구조, 다단계 추론 및 해석 가능한 불확실성을 요구하는 reasoning에서 불신뢰를 유발합니다. 이 논문은 자연어 reasoning 문제를 실행 가능한 형식적 표현으로 변환하는 neuro-symbolic 프레임워크를 제시합니다. 이를 지원하기 위해 나스-Reasoning-v0.1 벤치마크를 소개합니다. 이 벤치마크는 자연어 reasoning 문제와 FOL 형식, 실행 가능한 나르세스 프로그램, 그리고 세 가지 골드 레이블(True, False, Uncertain)을 포함합니다. 또한, FOL에서 실행 가능한 나르세스로의 결정적인 컴파일 파이프라인을 개발하고, OpenNARS for Applications(ONA)에서 런타임 실행을 통해 예제를 검증합니다. 이를 통해 심볼릭 타겟이 의도한 답변과 동작적으로 일치한다는 것을 확인할 수 있습니다. 나아가, Language-Structured Perception(LSP) 형식을 제시합니다. 이 형식은 LLM이 reasoning-relevant 심볼릭 구조를 생성하는 대신, 최종 언어적 응답만 생성하는 것을 목표로 합니다. 초기 증명은 Phi-2 LoRA 어댑터를 NARS-Reasoning-v0.1에 대해 교육하고, 세 레이블 reasoning 분류에 대해 지원하는 것을 보여줍니다. 결론적으로, 이 논문은 실행 가능한 심볼릭 생성 및 실행 기반 검증을 통해 더 신뢰할 수 있는 neuro-symbolic reasoning 시스템을 구축하는 실용적인 경로를 제시합니다.

에이전트 4월 17일

지오 에이전트 벤치: 공간 분석 도구 확장 에이전트를 위한 동적 실행 벤치마크

지오 에이전트 벤치(GeoAgentBench)는 지리 정보 시스템(GIS)과 대규모 언어 모델(LLM)의 통합이 자율 공간 분석의 새로운 패러다임을 열고 있습니다. 그러나 이러한 LLM 기반 에이전트를 평가하는 것은 복잡한 공간 워크플로우의 특성으로 인해 어려울 수 있습니다. existing 벤치마크는 정적 텍스트 또는 코드 매칭에 의존하여, 동적 런타임 피드백과 공간 출력의 다중 모드 특성을 무시합니다. 이를 해결하기 위해, 우리는 지오 에이전트 벤치(GABench)를 도입합니다. GABench는 117 개의 원자 GIS 도구를 통합하여, 6 개의 핵심 GIS 도메인에서 53 개의 일반적인 공간 분석 과제를 제공합니다. 정확한 매개 변수 구성이 동적 GIS 환경에서 실행 성공의 주요 요인은 인식하고, Parameter Execution Accuracy(PEA) 지표를 설계하여, implicit 매개 변수 추론의 신뢰도를 측정합니다. 또한, Vision-Language Model(VLM) 기반 검증을 제안하여, 데이터-공간 정확도와 cartographic 스타일 준수도를 평가합니다. 매개 변수 불일치 및 런타임 이상 현상으로 인한 빈번한 과제 실패를 해결하기 위해, 우리는 Plan-and-React라는 새로운 에이전트 아키텍처를 개발하여, 전역 조정과 단계별 반응 실행을 분리합니다.

에이전트 4월 17일

에코머천트 위험 관리에서 GUI 에이전트의 실용적인 인터랙티브 벤치마크

GUI 에이전트의 실용적인 인터랙티브 벤치마크는 에코머천트 위험 관리에서 GUI 에이전트의 강력한 자동화 능력을 보여주지만, 기존의 인터랙티브 벤치마크는 주로 benign한 예측 가능한 소비자 환경을 타겟으로하고 있다. 고위험, 수사적 도메인인 실제 에코머천트 위험 관리의 효과성은 미흡하다. 이 틈새를 메우기 위해 RiskWebWorld라는 첫 번째로 현실적인 인터랙티브 벤치마크를 제시한다. RiskWebWorld는 8개의 핵심 도메인에서 생산 위험 제어 파이프라인을 통해 1,513개의 태스크를

AI 모델 4월 15일

도구 사용 언어 모델 에이전트의 조직 보급 시 실행 수준 프로파일링: A-R 행동 공간

대규모 언어 모델(LLM)은 점점 더 시스템 수준 연산을 수행할 수 있는 도구 확장 에이전트로 배포되고 있습니다. 기존 벤치마크는 주로 텍스트 정렬이나 작업 성공을 평가하는 데 집중했지만, 언어적 신호와 실행 가능한 행동 사이의 구조적 관계를 다양한 자율성 스타킹에서 평가하는 데 덜 주목했습니다. 이 연구는 행동 측정 방법을 도입하여 Action Rate(A)와 Refusal Signal(R)로 정의된 2차원 A-R 공간을 사용하여 실행 수준 행동을 측정합니다. 모델은 4개의 규범적 체제(Control, Gray, Dilemma, Malicious)와 3개의 자율성 구성(직접 실행, 계획, 반영)에서 평가됩니다. 이 방법은 실행과 거부를 분리된 행동 차원으로 특성화하고, 이들이 체제와 자율성 수준에 따라 시스템적으로 분배되는 방식에 따라 분포가 달라진다는 것을 보여줍니다. 반영 기반 스타킹은 위험한 상황에서 더 높은 거부를 유도하지만, 모델 간에 분배 패턴이 구조적으로 다르다는 것을 보여줍니다. A-R 표현은 단일 점수 대신_EXECUTION_LAYER_CHARACTERIZATION를 사용하여 단일 점수 대신_ CROSS-SECTIONAL_BEHAVIORAL_PROFILES, SCAFFOLD-INDUCED_TRANSITIONS, COORDINATION_VARIABILITY를 직접 관찰할 수 있습니다. 이 연구는 조직 환경에서 실행 특권과 위험 수용도가 다르기 때문에 도구 확장 LLM 에이전트를 분석하고 선택하기 위한 배포 지향적인 렌즈를 제공합니다.

에이전트 4월 15일

스페이스 아틀라스: 공간 인식 연구 에이전트 벤치마크를 위한 컴퓨트 그라운드드 리즌

스페이스 아틀라스는 공간 인식 연구 에이전트 벤치마크를 위한 새로운 디자인 패러다임인 컴퓨트 그라운드드 리즌(CGR)을 소개합니다. CGR은 정해진 계산을 통해 모든 해결 가능한 서브 문제를 해결한 후 대규모 언어 모델에 질문을 보내는 방식입니다. CGR은 두 가지 도전적인 벤치마크를 처리하는 싱글 에이전트-투-에이전트(A2A) 서버로 구현되었습니다. 하나는 multimodal spatial question-answering 벤치마크인 FieldWorkArena, 다른 하나는 75개의 Kaggle 머신 러닝 대회를 포함하는 MLE-Bench입니다. 또한 이 시스템은 대규모 언어 모델(LLM)에 질문을 보내기 전에 정해진 계산을 통해 공간 정보를 추출하고 관계를 정의하는 구조화된 공간 장면 그래프 엔진을 사용합니다.

에이전트 4월 15일

장기 예측 미라지? : 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패 원인 규명

대규모 언어 모델(LLM) 에이전트는 짧은 및 중간 장기 예측에서 강력하게 수행하지만, 장기 예측이 필요할 때 연장된, 상호 의존적인 행동 시퀀스에 대한 에이전트가 붕괴하는 것을 관찰합니다. 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패는 아직 제대로 규명되지 않았고, 이는 장기 예측 실패를 진단하고 비교하는 데 있어 원칙적인 방법을 제공하지 못합니다. 이 문제를 해결하기 위해, 우리는 HORIZON 이라는 초기 단계의 크로스 도메인 진단 벤치마크를 제안합니다. HORIZON을 사용하여, 우리는 다양한 모델 패밀리 (GPT-5 변형 및 Claude 모델) 의 최신 기술 (SOTA) 에이전트를 평가합니다. 또한, 우리는 장기 예측 실패를 진단하기 위한 트래젝토리 기반 LLM-as-a-Judge 파이프라인을 제안합니다.

AI 모델 4월 15일

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법 과학 연구를 바꾸는 대규모 언어 모델(LLM)의 잠재력을 인정하면서도, 연구자동화에 인간의 감독 없이 사용하는 것을 대신하여 연구자를 보강하고 권장하는 것이 좋다고 주장한다. 이를 위해 우리는 연구 저자들이 연구와 연구를 제시하는 방법을 개선하는 데 도움이 되는 목표된, 실행가능한 피드백을 생성하는 과제를 연구한다. 이 연구에서 우리는 피드백의 효과를 저자 중심의 두 축인 유효성과 저자 행동에 따라 구체화한

연구 4월 14일

공간적 compétence Benchmarks: 환경 내부 표현을 유지하고 제약을 고려한 액션 계획을위한 새로운 평가 기준

AI 모델의 공간적 compétence를 평가하기 위한 새로운 기준인 Spatial Competence Benchmark(SCBench)가 발표되었습니다. SCBench는 3개의 계층적 기능 버킷을 포함하여, 디터민이스트 체커 또는 시뮬레이터 기반 평가자에 의해 검증된 실행 가능한 출력 Нeed를 요구하는 태스크로 구성되어 있습니다.

에이전트 4월 14일

현실 세계 모바일 에이전트 성능 평가를 위한 모빌로우: 트라제로리 파이즈합

현실 세계 모바일 에이전트의 성능을 평가하기 위해 개발된 모빌로우는, GUI 인터랙션을 통해 사용자가 할당한 작업을 자율적으로 완료할 수 있습니다. 그러나 기존의 메인스트림 평가 벤치마크인 안드로이드 월드(AnderoidWorld)는 시스템 수준의 안드로이드 에뮬레이터에 연결하여 시스템 리소스의 상태에 기반한 평가 신호를 제공합니다. 그러나 실제 세계 모바일 에이전트 시나리오에서는, 많은 외부 애플리케이션들이 시스템 수준의 API를 노출하지 않아, 작업이 성공했는지 여부를 판단할 수 없기 때문에, 벤치마크와 실제 사용사례 간에 불일치가 발생하고, 모델 성능을 정확하게 평가하는 것이 어려워집니다. 이러한 문제를 해결하기 위해, 우리는 모빌로우를 제안합니다. 모빌로우는 임의의 외부 애플리케이션으로부터 태스크를 가져와 평가 프레임워크를 구축합니다. 다중 트라제로리 파이즈합을 기반으로 하는 효율적인 그래프 생성 알고리즘을 사용하여, 모빌로우는 상태 공간을 효과적으로 압축하고, 동적 인터랙션을 지원하며, 실제 세계 외부 애플리케이션 시나리오와 더 잘 일치합니다. 모빌로우는 20개의 널리 사용되는 외부 애플리케이션과 240개의 다양한 실제 세계 태스크를 포함하며, 풍부한 평가 지표를 제공합니다. 모빌로우의 평가 결과는 안드로이드 월드(AnderoidWorld)와 비교하여, 인간 평가와 더 잘 일치하고, 실제 작업 부하하에서 GUI 기반 모델을 훈련하는 데 도움이 됩니다.

AI 모델 4월 14일

객체 지향 세계 모델링: 체현된 사유와 계획을 위한 구조화된 프로그래밍 세계 모델링

객체 지향 세계 모델링(OOWM)은 대규모 언어 모델(LLM)의 사유 능력을 향상시키는 Chain-of-Thought(CoT) 프롬팅의 한계를 극복하기 위해 제안된 새로운 프레임워크입니다. OOWM은 소프트웨어 공학의 공식적 형식인 Unified Modeling Language(UML)을 사용하여 세계 모델을 구조화하고, 체현된 사유를 위한 새로운 방식으로 프로그래밍 세계 모델링을 제안합니다.

연구 4월 14일

AHC: 미니어처에 연속적인 물체 감지에 적합한 적응형 압축 기술

미니어처에 연속적인 물체 감지를 위한 효율적인 특성 압축이 필요합니다. 기존의 접근법은 고정된 압축 전략을 사용하여 다양한 작업 특성에 적응하지 못하여 suboptimal 메모리 사용과 심각한 망각을 유발합니다. 우리는 Adaptive Hierarchical Compression (AHC) 라는 새로운 메타 러닝 프레임워크를 제안합니다. AHC는 각 새로운 작업에 대해 5 단계의 내부 루프에서 gradient descent를 사용하여 적응할 수 있습니다. 또한, hierarchical multi-scale compression와 scale-aware ratios를 사용하여 FPN의 중복 패턴을 매칭할 수 있습니다. 세 가지 표준 베이스 라인(Fine-tuning, EWC, iCaRL)과 함께 CORe50, TiROD, PASCAL VOC 벤치마크에서 실험을 수행하여 AHC가 100KB의 재생 예산 내에서 실용적인 연속 감지를 허용하고, EWC 정규화와 특성 분산을 결합하여 경쟁적인 정확도를 달성할 수 있습니다.

에이전트 4월 14일

Troving Test on 스크린: 모바일 GUI 에이전트 인공화 능력 평가

이 연구에서는 모바일 GUI 에이전트가 인공화 능력을 갖출 수 있도록 하기 위해 'Troving Test on 스크린' 이라는 새로운 평가 지표를 제안합니다. 이 평가 지표는 에이전트가 자연스러운 동작을 구현하는지 여부를 평가합니다. 연구 결과, 대규모 언어 모델(LLM) 기반 에이전트는 자연스러운 동작을 구현하지 못하여 쉽게 감지됩니다. 따라서 연구에서는 에이전트 인공화 능력을 평가하기 위한 새로운 지표인 에이전트 인공화 능력 평가 지표(Agent Humanization Benchmark, AHB)를 제안합니다.

인기 태그