본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 5월 18일

SMCEvolve: 과학적 발견을 위한 순차적 몬테 카를로 진화

LLM-기반 프로그램 진화가 자동화된 과학적 발견의 강력한 도구로 등장했지만, 기존 프레임워크는 프로그램의 개별 구성 요소 설계에 대한 원칙적인 지침을 제공하지 않고, 검색이 수렴하는지 보장하지 않는다. SMCEvolve는 프로그램 검색을 reward-tilted 타겟 분포에서 샘플링하는 것으로 재구성하고, 이에 대한 근사치를 순차적 몬테 카를로 (SMC) 샘플러로 근사한다. 이 관점에서 세 가지 핵심 메커니즘은 adaptative parent resampling, mixture of mutation with acceptance, automatic convergence control로 나타난다. 또한, LLM-call 예산을 타겟 근사 오류에 대한 유한 샘플 복잡도 분석을 제공한다. SMCEvolve는 math, algorithm efficiency, symbolic regression, end-to-end ML 연구 벤치마크에서 state-of-the-art 진화 시스템을 능가하며, 자율 종료 시 LLM 호출 횟수가 더 적다.

에이전트 5월 18일

CAX-Agent: 경량 에이전트 하네스, MAPDL 자동화에 대한 신뢰성 가이드

대규모 언어 모델(LLM) 기반 MAPDL 유한 요소 시뮬레이션에서 경량 에이전트 하네스(CAX-Agent)가 제시된 연구는, 도메인별 실행 제어, 도구 캡슐화, 오류 회복 등이 구조화되지 않은 경우 출력이 일관되지 않고 작업 실패가 빈번하다는 문제를 해결하기 위해 도입되었다. 이 연구에서는 CAX-Agent의 아키텍처를 제시하고, 오류 회복 정책의 핵심 성분을 경험적으로 평가한다.

에이전트 5월 18일

스킬스미스: 경계 지침을 기반으로 한 런타임 인터페이스로 컴파일하는 에이전트 스킬

대규모 언어 모델(LLM)-기반 에이전트 시스템에서 스킬은 다양한 영역에서 널리 채택되고 있습니다. 기존 프레임워크에서는 스킬이 런타임 태스크와 매치되면 컨텍스트 지침으로 에이전트의 추론 루프에 주입되며, 특수한 태스크 해결 능력을 제공합니다. 그러나 이 실행 패러다임은 무의미한 컨텍스트 주입과 재귀적 스킬 별 추론 및 계획을 포함한 두 가지 주요 오버헤드를 유발합니다. 이를 해결하기 위해 우리는 경계-첫 번째 컴파일러-런타임 프레임워크인 스킬스미스를 제안합니다. 스킬 패키지를 오프라인으로 최소화된 실행 인터페이스로 컴파일하여, 스킬에서 미세한 운영 경계를 추출하여 에이전트가 런타임에서만 관련된 구성 요소에 동적으로 액세스하고 실행할 수 있도록 합니다. 이를 통해 무의미한 컨텍스트 주입과 재귀적 추론 오버헤드를 최소화할 수 있습니다.

AI 모델 5월 18일

AI가 인간과 상호작용할 때 이론적 마음의 개선이 실제로 이익이 되나요? 인터랙티브한 평가에서 실증적 발견

인간과 AI 간의 효과적인 사회적 상호작용을 위해 대규모 언어 모델(LLM)의 이론적 마음(TOM) 기능을 개선하는 것이 중요합니다. 그러나 현재의 벤치마크는 일반적으로 이야기 읽기, 세 번째 사람의 관점에서 다중 선택 문제를 측정하여 TOM 기능의 개선 여부를 평가합니다. 그러나 인간-AI(HAI) 상호작용의 첫 번째 사람, 동적, 그리고 개방된 성질을 무시합니다. 이 연구에서는 TOM 기능의 개선이 HAI 상호작용에 실제로 이익이 되는지 직접 조사하기 위해 새로운 TOM 평가의 인터랙티브한 패러다임을 제안하고, 4개의 대표적인 TOM 강화 기법을 4개의 실제 세계 데이터 세트와 사용자 연구를 통해 체계적으로 연구했습니다. 이 연구에서는 목적지향적인 작업(예: 코딩, 수학)과 경험지향적인 작업(예: 상담)을 포함하여, TOM 기능의 개선이 동적 HAI 상호작용에서 항상 더 나은 성과로 이어지지 않는다는 것을 발견했습니다. 이 연구는 TOM 평가에 대한 비판적 통찰력을 제공하고, 인간-AI의 조화에 대한 =====================================================

에이전트 5월 18일

SDOF: 멀티 에이전트 오케스트레이션의 대선형세기

멀티 에이전트 오케스트레이션 프레임워크는 LangChain, LangGraph, CrewAI를 포함하여 그래프 기반 파이프라인을 통해 태스크를 라우팅하지만 실제 비즈니스 프로세스를 지배하는 단계 제약을 강제하지 않습니다. SDOF 프레임워크는 멀티 에이전트 실행을 제약된 상태 머신으로 다루고, Online-RLHF Specialized Intent Router와 StateAwareDispatcher를 통해 작동합니다.

에이전트 5월 15일

가치 기반 에이전트로의 전환: LLM 기반 에이전트 γραfφ의 사회적 가치 적합성

대규모 언어 모델(LLM) 기반 에이전트의 광범위한 적용을 위해 인간 사회 가치와 강한 적합성이 필요합니다. 그러나 현재 연구는 자가 인식과 딜레마 결정, 자가 감정 등에서 결함을 보입니다. 이를 해결하기 위해 가치 기반 프레임워크를 제안하고, GraphRAG를 사용하여 원칙을 가치 기반 지시문으로 변환하고, 특정 대화 문맥에서 적합한 지시문을 검색하여 에이전트를 예상하는대로 행동하도록 제어합니다.

에이전트 5월 15일

과학 이론 전환을 감지하는 AI 에이전트의 Sheaf-이론적 운반 및 장애

과학 이론 전환을 감지하는 AI 에이전트가 데이터에 적합한 방정식을 맞추는 것 이상의 것이 필요하다. 인공 과학 에이전트는 기존의 표현적 프레임워크가 새로운 영역으로 운반될 수 있는지, 또는 그 언어가 지역적으로-global하게 장애가 발생하고 확장해야 하는지 감지해야 한다. 이 논문은 운반 및 장애를 통해 이론 전환 후보를 감지하는 유한 Sheaf-이론적 프레임워크를 개발한다.

에이전트 5월 15일

정치 뉴스 Nugget: 대규모 언어 모델(LLM) 기반 장소성 정보 통합 평가

정치 뉴스 Nugget은 대규모 언어 모델(LLM)을 장소성 프레임워크에 통합하여 정적 질문에 대한 긴 문맥 정보 검색을 개방형 탐색으로 변형시켰다. 그러나 실제 세계 사용에는 모델이 분산된 소스에서 '장거리' 사실을 발견하고 통합하는 능력이 필요하며, 이 능력은 평가되지 않았다. 정치 뉴스 Nugget은 400명의 글로벌 엘리트를 위한 정치 전기서를 구성하여 10,000개 이상의 정치 사실을 포함하는 다언어 벤치마크를 소개한다.

연구 5월 15일

개인화된 식사 최적화에 대한 혼합 정수 목표 프로그래밍

식단 최적화 문제는 운영 연구의 가장 오래된 최적화 문제 중 하나입니다. 그러나 기존의 형식에는 두 가지 지속적인 한계가 있습니다. 연속 변수는 실제적인 분수 섭취를 생성하고 (1.7개의 계란, 0.37개의 바나나), 그리고 강도 영양 섭취가 목표가 충돌할 때 불가능합니다. 56개의 식단 최적화 논문에 대한 체계적인 검토는 integer programming과 goal programming을 모두 결합하는 논문이 없다는 것을 발견했습니다. 우리는 개인화된 식사 최적화를 위한 혼합 정수 목표 프로그래밍(MIGP)을 제안합니다. 이 형식은 실제적인 섭취 수를 위한 정수 변수를 사용하고, 목표 영양 섭취를 위한 goal programming의 변동을 사용합니다. 또한, multi-nutrient 최적화를 균형시키기 위해 역-목표 정규화(INN)를 사용합니다. 식품당 섭취의 자연 단위(한 개의 계란, 한 자루의 기름)를 허용하기 위해 per-food 섭취의 세분성은 자연 단위로 유지됩니다.

에이전트 5월 15일

그래프비트: 비선형 에이전트 오케스트레이션을 위한 그래프 기반 에이전트 프레임워크

그래프비트는 대규모 언어 모델(LLM) 프레임워크에서 잘못된 라우팅, 무한 루프, 비재현성 실행을 방지하기 위해 개발된 그래프 기반 에이전트 프레임워크입니다. 이 프레임워크는 워크플로우를 명시적으로 정의하고, 에이전트가 타입 함수로 작동하며, 엔진이 라우팅, 상태 전환, 도구 호출을 관리하여 재현성과 감사성을 보장합니다.

에이전트 5월 14일

안드로이드가 게임을 깨는 꿈을 꾸는가? BenchJack으로 AI 에이전트 벤치마크를 체계적으로 감사하는 방법

AI 에이전트 벤치마크는 현재 프론티어 AI 능력의 표준으로 사용되고 있습니다. 그러나 reward hacking이 발생하여 에이전트가 의도한 작업을 수행하지 않고 점수를 최대화하는 문제가 발생하고 있습니다. 벤치마크가 보안을 위한 디자인으로 구현되어야 한다는 것을 주장합니다.

AI 모델 5월 13일

LLM 허구감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察

LLM 허구 감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察 LLM 허구, 즉 신뢰할 수 없는, 가짜, 또는 일관성이 없는 콘텐츠를 생성하는 LLM에 의해 생성되는 내용을 광범위하게 의미하는 것으로, 광범위한 영향력을 가지고 있다. 따라서 LLM 허구 감지를 감지하고 이러한 감지기 평가를 위해 설계된 벤치마크 데이터 세트를 디자인하는 데에 크게 노력한 바 있다. 이 연구에서, 우리는 허구 감지 벤치마크(HDB)의 효과적인 평가를 위해 보여주어야 하는 속성의 필요

AI 모델 5월 13일

데이터 가치 최적화: 데이터 특성화 활용을 통한 저데이터 환경에서의 데이터 절단

저데이터 환경에서 데이터 절단을 위한 데이터 특성화 활용을 제안하는 연구입니다. 연구에서는 기존의 데이터 주성분 분석 방법을 개선하고, 데이터 특성화에 기반한 데이터 절단 기법을 제안합니다. 제안된 기법은 데이터 특성화에 기반하여 데이터 절단을 수행하며, 데이터 절단 후 모델의 성능을 향상시키는 데 도움이 됩니다.

에이전트 5월 12일

건강관리 AI를 위한 성능 측정: 생성적, 다모드, 그리고 주체적 AI를 위한 벤치마크

건강관리 AI를 위한 성능 측정은 복잡한 실세계 워크플로우에서 신뢰성, 안전성, 및 임상적 중요성을 측정하는 체계적인 방법이 부족하다. 대부분의 벤치마크는 모델이 무엇을 알고 있는지 테스트하지만, 실세계 임상 작업의 전체 복잡성을 고려한 신뢰성과 실패를 테스트하는 벤치마크는 부족하다.

연구 5월 12일

도구 확장 언어 모델을 위한 CoCoDA: 컴포지셔널 DAG의 공동 진화

도구 확장 언어 모델은 작은 언어 모델에 외부 실행 가능한 스킬을 추가할 수 있지만 도구 라이브러리를 확장하는 것은 새로운 재사용 가능한 서브루틴이 발생할 때 계획자와 함께 진화해야 하며, 검색은 고정된 컨텍스트 예산 내에서 유지해야 한다. 기존의 도구 사용 및 스킬 라이브러리 방법은 도구를 평평한 메모리나 텍스트 인덱스 메모리로 처리하기 때문에 라이브러리 크기에 따라 지시 첨부 비용이 증가하고, 실행 가능한 코드의 타입화된 컴포지셔널 구조가 묻힌다. 우리는 CoCoDA를 제안한다. CoCoDA는 컴포지셔널 코드 DAG를 통해 계획자와 도구 라이브러리를 공동 진화하는 프레임워크이다. 노드는 원소 또는 복합 도구로, 엣지는 호출 의존성을 인코딩하고, 각 노드는 타입화된 서명, 설명, 전/후 조건 사양, 예시를 저장한다. 추론 시간에, 타입화된 DAG 검색은 후보를 심볼릭 서명 일치로 필터링하고, 생존자들을 설명에 따라 순위 매기고, 행동 사양에 의해 필터링하고, 예시를 통해 불명확성을 해소한다. 이 때, 비용이 많이 드는 컨텍스트 재현을 점진적으로 작아지는 후보 집합에 유지한다. 훈련 시간에, 성공적인 경로를 유효화된 복합 도구로折입하고, 계획자는 DAG 유도된 보상을 사용하여 복합 도구의 원소 확장 크기에 따라 크레딧을 받는다. 우리는 검색 비용 감소, 선형 검색 시간, 형성된 보상 하에서 컴포지셔널 이점, 보수적인 업데이트하에 모노톤 공동 진화, DAG의 잘못된 형태를 보여준다. 수학적 논리, 표 형태 분석, 코드 작업 벤치마크에서, CoCoDA는 8B 학생이 GSM8K와 MATH에서 32B 교사와 일치하거나 초과하는 것을 허용하고, 강력한 도구 사용 및 라이브러리 학습 베이스 라인에 비해 지속적으로 개선한다.

AI 모델 5월 12일

메모큐(MemQ): 자가진화하는 경험기억을 위한 Q러닝 통합

자연어 처리 대규모 언어 모델(LLM) 에서 경험기억을 축적하고 검색하는 것을 허용하지만, 현재의 방법은 각 기억을 독립적으로 평가하고 있기 때문에, 기억이 미래의 기억을 생성하는 의존성 체인에 대한 계산을 고려하지 못하고 있습니다. 메모큐(MemQ)는 TD(λ)가치 추적을 사용하여 기억 Q-값에 적용하고, 기억이 생성될 때 검색된 기억을 기록하는 증명성 DAG에 대한 후방 신호를 전파합니다. 신호의 가중치는 DAG의 깊이 d에 따라 (γλ)^d로 감소하고, 시간적 거리 대신 구조적 근접성을 사용합니다. 실험 결과, 6개의 벤치마크에서 메모큐(MemQ)는 일반화 평가와 런타임 학습에서 최고의 성공률을 달성했으며, 다단계 태스크에서 가장 큰 이익을 보였습니다.

AI 모델 5월 11일

웹리카: 시각 웹 에이전트를 위한 대규모 및 재현 가능한 훈련 환경

웹이 복잡하고 열람되지 않은 상태로 항상 변해가며, 시각 웹 에이전트를 위한 훈련 데이터를 확장하는 것은 어려운 과제입니다.目前의 데이터 수집 시도는 주로 오프라인 트래제로의 초점을 맞추거나 RL 훈련을 위한 몇몇 시뮬레이션 환경을 사용하여, 웹의 다양성을 포착하지 못하고 있습니다. 이 문제를 해결하기 위해, 우리는 웹리카(웹 복제)라는 프레임워크를 제안합니다. 이 프레임워크는 1) HTTP 레벨 캐싱을 사용하여 안정적인 시각 상태를 캡처하고 재생하며, 상호 작용을 유지하고 2) LLM 기반 환경 합성기를 사용하여 실제 웹 사이트와 웹 내비게이션의 핵심 기술을 기반으로 합니다. 이 프레임워크를 사용하여, 우리는 RL 훈련을 수천 개의 다양한 환경과 태스크에 확장합니다. 우리의 최상의 모델, 웹리카-8B는 여러 웹 내비게이션 벤치마크에서 열린 가중치 기준과 같은 크기의 모델을 능가하며, 추가 테스트 시간 컴퓨팅에 유리하며, API 모델과 경쟁할 수 있습니다.

에이전트 5월 8일

인간이 아닌 AI가 발견한 교환-상호 작용 밀도 함수

인간이 아닌 AI가 개발한 새로운 밀도 함수 Adsorbent는 현재까지 가장 정확한 밀도 함수를 개발하는 데 있어 여전히 큰 도전 중입니다. 인간이 물리적 직관, 정확한 제약, 경험적 적합을 결합하여 수없이 많은 밀도 함수를 개발해 왔습니다. 최근 대규모 언어 모델(LLM)의 발전은 인간이 직접 설계하는 수동적 디자인 루프에 대한 체계적이고 자동화된 대안을 제공합니다. 이 보고서에서는 LLM이 진화적 역사를 안내받아 구조화된 함수 형태 변경을 제안하는 의사결정 검색 시스템을 제시합니다. 이 시스템은 함수 성능을 개선하기 위해 반복되는 계획-실행-요약 루프를 통해 함수 성능을 개선합니다. 성능을 측정하기 위해 표준 열화학 데이터 세트에 함수 매개변수를 최적화하고, 나중에 보류된 부분에 성능을 평가합니다. 가장 강력한 발견된 함수, SAFS26-a는 금본계 {\omega}B97M-V 기준에 대해 ~9%의 향상을 보입니다. 이 결과는 AI-assisted 과학의 경고적인 교훈을 제공합니다: 모델이 실제 개선 발견을 가능하게 하는 충분한 힘은 동시에 벤치마크를 게임하기 위해 불합리한 단축을 이용할 수 있습니다. 도메인 전문성은 결과를 과학적으로 기반으로 유지하기 위해 명시적으로 적용된 제약이 필수적입니다.

에이전트 5월 8일

로직의 대화: BALAR, 인간과 대화하는 대규모 언어 모델(LLM)의 능동적 사고

대규모 언어 모델(LLM)은 사용자와의 다중 라운드 정보 교환을 필요로 하는 인터랙티브 설정에서 점점 더 많이 작동하고 있습니다. 그러나 대부분의 현재 시스템은 대화에 반응적으로 다루고, 정보가 누락된 것을(reasoning about what information is missing) 및 다음에 질문을 선택하는(principled mechanism to reason about which question should be asked next) 데 대한 원리적인 메커니즘을 가지고 있지 않습니다. BALAR(Bayesian Agentic Loop for Active Reasoning)이라는 새로운 알고리즘을 제안합니다. 이 알고리즘은 task-agnostic outer-loop 알고리즘으로, fine-tuning이 필요하지 않고 대규모 언어 모델(LLM) 에이전트와 사용자 간의 구조화된 다중 라운드 상호 작용을 허용합니다. BALAR은 latent states에 대한 구조화된 믿음을 유지하고, expected mutual information을 최대화하여 clarifying 질문을 선택하고, 현재 상태 표현이 부족할 때 동적으로 상태 표현을 확장합니다. BALAR은 detective cases, thinking puzzles, clinical diagnosis과 같은 다양한 벤치마크에서 모든 baseline을 능동적으로 물리치고, AR-Bench-DC에서 14.6%의 정확도 향상, AR-Bench-SP에서 38.5%의 정확도 향상, iCraft-MD에서 30.5%의 정확도 향상이 있습니다.

에이전트 5월 8일

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹 기업 에이전트는 점진적 검색 시스템, 위임된 워크플로우 및 정책 제약 증거 환경 내에서 점점 더 많이 작동하고 있다. 이러한 환경에서 접근 제어는 시스템이 호출자 권한 구간 외부에 있는 물리적 증거가 있더라도 완전한 답변을 생성하는 동안도 올바르게 적용될 수 있다. 이 논문은 Partial Evidence Bench라는 결정론적 벤치마크를 소개한다. 이 벤치마크는 72개의 태스크를 포함하는 3개의 시나

인기 태그