본문으로 건너뛰기

#벤치마크

333개의 기사

연구 6월 18일

월드 라인: 장기 상태 기반 몸체_AGENT의 성능 평가 및 모델링

인공 지능이 인간을 돕기 위해 오랜 기간 동안 실제 집에서 hoạt동할 수 있도록 하기 위해서는, 사용자의 일상 routine, 세계 상태, 과거 상호 작용을 기억해야 합니다. 현재의 장기 기억 평가 기준은 주로 언어 중심의 검색과 질문에 대한 답변에 초점을 맞추고 있습니다. 반면에, 신체화된 평가 기준은 종종 단기적인 과제 실행에 중점을 두며 장기 기억 사용을 동적 환경에서 테스트하지는 않

에이전트 6월 18일

로보컵 2D 축구 환경을 위한 다중 agent 강화 학습: R2D-RL

로보트 축구는 부분적 관찰성, 협력 및 적대적 상호 작용, 희소 보상, 그리고 장기 전략 행동이 결합된 다중 agent 강화 학습의 어려운 테스트베드로 간주된다. 로보트 컵 2D 축구 시뮬레이션(RCSS2D)은 성숙한 로보트 축구 플랫폼을 제공하지만, 현대 Python 기반 MARL 워크플로우와 직접적으로 사용하기 어려운 경쟁기반 서버-클라이언트 아키텍처를 가지고 있다. 우리는 R2D-RL이

AI 모델 6월 18일

시뮬레이션 월드 예측 벤치마크 시스템: ForecastBench-Sim

일반 목적 인공지능 시스템의 예측 벤치마크는 일반적으로 실제 세계의 제약을 물려받습니다: 결과가 천천히 결정되며, 꼬리 현상이 드물며, 역추적 질문이 어려운 것입니다. 우리는 게임 롤아웃에서 Freeciv를 기반으로 한 시뮬레이션 세계의 예측 벤치마크인 ForecastBench-Sim을 소개합니다. [대규모 언어 모델(LLM)]을 위한 예측 벤치마크는 일반적으로 실제 세계의 제약을 물려받습니

AI 모델 6월 18일

의무적 추론의 기초 모델에 대한 의무적 추론 성능 평가 지표

연구자들은 논리적 추론을 위한 새로운 벤치마크인 DeFAb을 발표했다. 이 벤치마크는 논리적 추론을 위한 규칙 기반 로직 솔버를 사용하여 100% 정확도로 모든 인스턴스를 50마이크로초 이하로 해결할 수 있다. 반면, 대규모 언어 모델(LLM)은 최고 65%의 정확도를 달성하고, 렌더링 강화 평가(worst case over four surface renderings)에서 23.5%의 정확도

AI 모델 6월 18일

NAVI-Orbital: 자율 천문 관측을 위한 초보 반영구적 시각-언어 모델의 첫 우주 데모

지구 관측 데이터의 생성 속도와 지상에서 사람이 참여하는 처리 속도는 지구 관측 데이터를 다운받는 대역폭과 지구 관측 데이터를 분석하는 속도 사이의 격차를 만들고 있다. 이 논문은 NAVI-Orbital이라는 소프트웨어 시스템을 Low Earth Orbit(Low Earth Orbit, LEO) 위성에 배치한 것이다. 2026년 4월 16일, NAVI-Orbital은 대규모 언어 모델(LLM

에이전트 6월 17일

행동 기반 암시적 결정 요인에 기반한 만족도 인식하는 맵 에이전트의 성능 평가: MapSatisfyBench

대규모 언어 모델 에이전트가 점차적으로 지도 서비스에 통합되고 있습니다. 지도 서비스는 일상 생활 시나리오에 비해 전문적인 업무 환경에 통합되지 않기 때문에 사용자는 종종 사용자의 필요를 구체적으로 표현하지 못하고, 명시적으로 표현하지 못한 여러 가지 필요, 즉 암묵적 결정 요소들을 포함하는 미분명한 질의를 내놓습니다. 이러한 문제를 해결하는 가장 효과적인 방법은 사용자와의 대화에서 명확성을

연구 6월 17일

의료 음성 인공지능의 멀티태스킹 벤치마크

음성은 신경계, 운동계, 호흡계, 음성계를 동시에 관여하는 독특한 건강 정보 창문을 제공합니다. 현재 임상 음성 인공지능 방법론은 주로 특정 질병에 대한 고립된 연구를 통해 발전해 왔습니다. 따라서 결과를 비교하고 일반화 정도를 평가하는 것이 어려웠습니다. 우리는 임상 음성 인공지능을 위한 대규모 벤치마크인 SpeechDx를 소개합니다. SpeechDx는 12개의 데이터셋과 27개의 작업을

AI 모델 6월 17일

장기 기억의 최종 정확도에서 놓친 부분을 탐색하는 MemTrace

대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 그러나 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을独立으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다. 우리는 MemTrac

연구 6월 17일

재취업 준비를 고려한 생산-재고 관리 시스템에 대한 위기 상황을 고려한 성능평가 표준: SkillChain-Gym

작업 능력은 점진적으로 생산 계획의 결정 변수로 취급해야 한다. 자격증은 기술을 유지하지 않으면 만료되며, 현재 근로자들이 보유하지 못하는 새로운 제품이 필요하고, 재교육은 생산에 필요한 동일한 근로자 시간을 경쟁한다. 기존의 운영 벤치마크는 일반적으로 노동을 외생 변수로 취급하며, 기술과 학습을 고려한 근로자 계획 모델은 재교육을 고려한 재사용 가능한 테스트베드로 드물게 공개된다. 우리는

에이전트 6월 17일

규칙이 학습할 때: 법적 사례 검색을 위한 자율 진화 요소

법률 문서 검색은 법률 용어의 복잡성과 쿼리와 관련된 문서 간의 정확한 단어 대응이 필요한데다 어려움을 겪고 있습니다. although dense retrieval models는 눈에 띄는 진전을 이루었지만, 실증 연구 결과 BM25는 여전히 이 영역에서 강력한 기준선으로 기능하고 있습니다. 그러므로 BM25를 parameter training없이 향상시키는 rule-driven query

LLM PC 6월 16일

가정 가능한 자율 데이터 과학을 위한 증명 가능한 데이터 과학: 툴-기반 논리 reasoning을 통해 불규칙 TSQA 해결

실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대

에이전트 6월 16일

컴퓨터 사용 에이전트의 안전성 평가를 위한 벤치마크

컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용

AI 모델 6월 15일

포커 아레나: 전략적 사고와 LLM의 기억능력 다중 축 프로파일링

불확실성을 감안한 전략적 사고는 협상, 금융, 정책 등에서 중요한 결과를 내는 결정에 기반을 두고 있지만 현재 게임 벤치마크는 다양한 사고 차원들을 단일 스칼라로 축소시키고 있다. 이로 인해 최첨단 대규모 언어 모델(LLM)의 기능 구조가 조사되지 않았다. 우리는 포커 아레나(Poker Arena)라는 무제한 텍사스 홀덤 토너먼트 플랫폼을 소개한다. 이 플랫폼은 세 가지 메모리 아키텍처(한

AI 모델 6월 15일

LLM을 이용한 수학적 분석의 정리 증명에 대한 두 단계 평가 시스템: MA-ProofBench

대규모 언어 모델(LLMs)은 자동 증명 논리를 크게 진전시키면서도 현재까지 존재하는 공식 평가 지표는 수학적 범위와 난이도에서 모두 제한적이다. 대부분은 대수학과 초등 수학적 수학 이론과 같은 더 쉽게 공식화되는 분야에 집중되어 있으며, 더 깊은 사고를 요구하는 하위 분야인 수학적 분석에 대한 범위는 제한적이다. 이러한 공백을 해결하기 위해 우리는 Mathematical Analysis를

에이전트 6월 15일

다중 BI: 비즈니스 지능성 داش보드와 효율적인 증강된 상호작용을 위한 자율적인 디지털 트윈

사업 지능(BI)은 최근 대규모 언어 모델(LLM) 기반 지원과 대시보드 상호 작용을 결합하고 있지만, 다단계 분석 시 두 가지 모드가 동기화되지 않아 어려움을 겪고 있다. 사용자가 직접 대시보드 조작과 자연어 질의 사이에서-switch 할 때, 필터, 계층, 지표, 차트 콘텍스트와 같은 분석적 상태를 일관성 있게 유지하는 것이 어려워진다. 우리는 두 가지 모드를 동시에 사용하는 동안 일관성

에이전트 6월 15일

작업환경의 재조명: 2년이 지난 작업환경 대리인

arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%

LLM PC 6월 15일

강화학습 기반 트랜스포머 메서드: 개방 공장 생산 계획 문제 해결

인공 뉴스 기사 : arXiv:2606.13682v1 주제 : 개방점검이 스케줄링 문제 개요 : 개방점검이 스케줄링 문제는 많은 산업 및 서비스 환경에서 발생하지만 작업과 기계의 수가 증가함에 따라 계산적으로도 어려운 문제이다. 정확한 방법은 빠르게 불가능한 반면, 기존의 배포 규칙과 메타 휴리스틱은 대규모 스케일에서 해의 품질을 유지하기 위해 많은 조정을 필요로 한다. 이 연구에서는 OSS

에이전트 6월 12일

과학적 난제를 다양한 규모에 대처하는 인공지능 agent의 성능 평가

과학적 발견을 가속하기 위해 개발 중인 인공지능(AI) agent의 실질적인 능력은 실제 연구 환경에서 아직도 잘 이해되지 않았다. 현재까지 AI agent를 평가하기 위한 표준 벤치마크는 과학적 작업을 수행하는 데 필요한 복잡성, 다양성, 연장된 논리 reasoning을 거의 반영하지 못하고 있다. 반면 과학적 과제에 대한 벤치마크는 연구를 정적이고 직접적인 문제로 축소시키며, 상호 작용

LLM PC 6월 12일

LLM에서 매개변수 도구 지식 감사에 대한 진단 Framework: ToolSense

대규모 언어 모델(LLM)을 대량 도구 카탈로그에 적용하여 도구 검색을 수행할 때, 중요한 도구 검색 병목 현상이 발생한다. 임베딩 기반 검색 접근 방식은 특화된 도구 의미를 충분히 포착하지 못하는 짧은 인코더를 사용하기 때문에, 파라메트릭 도구 검색은 이 문제를 해결하기 위해 LLM 사전에 도구를 가상 토큰으로 추가하여, 두 단계의 훈련(기억 단계 및 검색 단계(SFT))을 통해 LLM을

인기 태그