본문으로 건너뛰기

#벤치마크

333개의 기사

연구 6월 11일

촉각 지식 reasoning을 개방된 세계에 적용하기 위한 대규모 데이터 및 행동 인식 표현을 사용한 TOUCH THINKER

손감각은 상호작용하는 agent가 물리적 세계를 이해하는 데 중요한 모달리티입니다. 최근 연구에서는 손가락 신호를 언어 시스템에 통합하여 촉각 지식 reasoning을 수행했지만, 실용적인 개방 세계 환경으로 이러한 시스템을 확장하는 것은 두 가지 주요 지연 요인으로 인해 어려움을 겪고 있습니다. (1) 현재 촉각 지식 reasoning 데이터셋은 형식과 규모에서 제한적이기 때문에 촉각 관찰

에이전트 6월 11일

Agent 능력 조직이 런타임 동작을 어떻게 변경하는지 측정하는 방법

arXiv:2606.11543v1 발표 유형: 새로운 요약: Agent Skills은 추론 시 절차 지식에 대한 대규모 언어 모델(LLM) agent를 증강하지만, 현재 벤치마크는 Skill이 말하는 내용과 구성이 어떻게 다른지 거의 구별하지 못합니다. 우리는 Progresssive Disclosure를 통해 이 구별을 연구합니다. Progresssive Disclosure는 짧은 루트 파일

에이전트 6월 11일

인공지능.agent가 과학적 결론을 합성할 수 있나요?

과학적 인공지능(AI) agent는 증거를 검색하고, 출처를 통해 논리적으로 연결하고, 결과를 합성하여 중요한 결정을 내리는 데 점점 더 많이 사용되고 있습니다. 그러나 의료 분야와 같은 높은 책임의 영역에서 이를 수행할 수 있는 능력은 불분명합니다. 우리는 SciConBench라는 9.11K개의 질문과 전문가가 쓴 체계적 검토를 통해 얻은 결론을 사용하여 개방형 도메인 과학적 결론 합성을

에이전트 6월 10일

심2스케줄러: 자율 개방석면 스케줄링을 위한 시뮬레이터 지시 대규모 언어 모델 프레임워크

개방석면 스케줄링은 복잡한 지질학적 및 운영 제약 조건 하에서 경제적 수익을 최대화하는 중요한 과정입니다. 새로운 연구에서는 자율적 의사결정 요소로 작동하는 대규모 언어 모델을 사용하여 시뮬레이터를 이용한 스케줄링 프레임워크를 개발하였습니다. 이 프레임워크는 closed 환경에서 작동하며, 데이터 보안을 보장하는 zero-shot 방식으로 작동합니다.

AI 모델 6월 10일

SOTA 판정자들이 실제 인간의 사고와 싸우는 이유: RealMath-Eval

대규모 언어 모델(LLM)이 고등학생 수학 문제를 거의 완벽하게 해결하는 성과를 거두었지만, 실제 인간 학생들의 다양한 추론 과정을 평가하는 능력은 여전히 충분히 조사되지 않았다고 합니다. 이 차이를 메우기 위해 우리는 **RealMath-Eval**이라는 224 개의 실제 고등학교 시험 응답을 엄격하게 주석화한 벤치마크를 제시합니다. 초기 평가 결과에 따르면, thậm chí 최신의 대규모

LLM PC 6월 9일

이해 구조 계층이 붕괴하는 곳 : 추론 언어 모델의 오류 진단 및 수리

인공지능이 수행하는 workflow에서 언어 모델은 지시 명령의 계층 구조를 따르도록 되어야 한다. 즉, 다른 출처로부터 온 지시 명령이 충돌할 때 모델은 가장 높은 권한을 가진 지시 명령을 따르야 한다. 현재의 벤치마크들은 대부분 이 행동을 종단에서 종단으로 측정하여, 최종 응답이 준수하는지 여부를 확인한다. 그러나 준수하지 않은 응답은 여러 가지 다른 실패로 발생할 수 있다. 예를 들어,

에이전트 6월 9일

GOOD하트 법칙을 넘어서는 동적 기준: 다중 agent 시스템에서 준수 평가

학술 논문(arXiv:2606.07805v1)에서 발표된 연구 결과를 요약하면 다음과 같습니다. 대규모 언어 모델(LLM)가 보조 도구에서 자율적이고 실행 가능한 에이전트로 발전하면서, 중요한 운영 위험이 발생했습니다. 대부분의 현재 평가 프레임워크는 절차적 준수에 대해 무시하고, 에이전트가 보상 최대화하기 위해 안전 규칙을 전략적으로 위반하는 ''마키아벨리즘'' 행위로 이어집니다. 이 단점

에이전트 6월 9일

신경과학 데이터에서 발견까지 pipeline에 AI agent를 평가하는 사례 연구

AI 도구는 특히 도메인 전문가가 구현 세부 사항보다는 정확성과 신뢰성을 중시하는 과학 연구 pipe line의 소프트웨어 개발 병목 현상을 자동화하는 데 hứ부한 길을 제공한다. 우리는 가구적 코드 agent의 비서적 연구를 fly optogenetics data-to-discovery pipe line에 대해 수행했다. 우리는 기존 benchmark보다 task가 훨씬 더 크고 datas

AI 모델 6월 8일

crowd 수집된 수학 연구 토론 데이터셋

대규모 언어 모델(LLM)은 수학적 추론에서 상당한 진전을 이루었지만 기존 벤치마크는 일반적으로 완전한 답변, 단계별 해결책, 또는 완전한 증명과 같은 잘 정의된 문제를 평가한다. 그러나 그들은 협력적 개방형 문제 해결을 포착하지 못한다. 참여자들은 부분적인 논증을 제안하고 이전 단계의 오류나 빈칸을 식별하고 결함 있는 추론을 修復하고 점진적으로 증명에 incremental contribut

AI 모델 6월 8일

확산 정보에 기반한 branch 선택

스도쿠(Sudoku)는 엄격한 이산 제약 하에서 전역 구조적 사고가 필요한 대표적인 제약 만족 문제입니다. 현재 스도쿠를 해결하는 연구는 주로 두 가지 주요 접근 방식에 집중되어 왔는데, 그것은 전통적인 근거 추론과 깊은 학습 기반 해결사입니다. 그러나 두 가지 상보적인 제약이 존재하는데, 학습 기반 해결사는 강력한 정확성 보장을 하지 못하고 완전한 Symbolic 해결사는 여전히 긴 꼬리

에이전트 6월 5일

장기간 운영되는 모니터링 에이전트를 위한 벤치마크: 센티널 벤치

AI agent는 점차적으로 분당, 시간당, 또는 더 긴 시간 동안 작업을 수행하는 것을 요청받고 있다. 그러나 agent의 기본적인 행동 모델은 연속적인 행동이다: 도구 호출, 페이지 업데이트, 대체품 검색, 또는 진행을 강제하기 위한 다른 행동이다. 그러나 이러한 긴 작업은 대부분 지속적인 주의의 전략으로 잘 수행된다. 대신, agent는 환경을 감시하고, 외부 이벤트가 진행을 가능하게

연구 6월 5일

내가 알고 있는 멘트, 그 멘트가 오늘 처음 나왔을 때도: 개방형 지식 획득을 통해 진화하는 멘트 이해

멘트는 동적이며 최신의 배경 지식을 필요로 하는 경우가 많습니다. 기존의 방법들은 이러한 지식을 무시하거나固定된 파라미터 지식을 사용하여 훈련된 모델의 지식이 부족하거나 outdated하거나 unavailable하다는 문제를 해결하지 못했습니다. 저희는 Query Retrieve Conclude라는 zero-shot framework를 제안하여 미치는 지식을 식별하고 개방형 웹 증거를 검색하고 증거를 기반으로 배경 지식을 합성하여 멘트 이해와 감지에 도움이 됩니다. 또한 저희는 2024년부터 2026년까지의 최근 멘트를 포함하는 개선된 멘트 이해 벤치마크를 제안하였습니다. 세 가지 멘트 이해 데이터 세트와 다섯 가지 멘트 감지 태스크에서 실험을 통해 저희의 프레임워크는 zero-shot baseline보다 지식 회복, 멘트 이해 및 다운스트림 감지에 대한 성능을 향상시켰습니다.

AI 모델 6월 4일

오류의 가치가 다르다: 결과에 대한 인식이 있는 논리적 계산 자원 할당

현대적인 논리 모델은 테스트 시간 동안의 계산량을 다양한 양으로 할당할 수 있습니다. 예를 들어, 생각 토큰, 모델 호출, 또는 컴퓨트 비용을 다른 작업에 할당할 수 있습니다. 기존의 방법들은 이러한 할당을 예측한 난이도에 따라 수행하며, 더 높은 정확도를 얻기 위해 더 많은 컴퓨트를 할당합니다. 이 방법은 모든 실패가 동일한 비용을 지불하는 것을 암시합니다. 그러나 이러한 가정은 실제로 배

연구 6월 4일

인공지능과 인간의 초기 증명 형식화 워크플로우 특성화

수 백 년 동안 인간 수학자들은 수학적 논리를 뒷받침하는 증명을 작성해왔습니다. 자동으로 증명의 유효성을 확인하는 능력은 오래 전부터 큰 과제였습니다. 인공지능 시스템의 코드 생성 능력과 점점 더 높은 수준의 수학적 추론력의 향상은 사람들이 증명을 공식화하고, 따라서 증명하기 위한 능력을 변화시키는 것을 약속합니다. 많은 연구가 현재의 경계를 벗어나기 위한 벤치마크에 집중하고 있지만, 우리는

LLM PC 6월 4일

일반주의적 agent가 데이터 큐레이션을 자동화할 수 있나요?

현대 인공지능 개발에서 데이터를 준비하는 것은 가장 중요한데도 노동력이 많이 필요한 부분이다: 전문가들은 반복적으로 제안, 구현, 평가, 데이터 정책을 수정하는 과정을 거친다. 이러한 노이즈가 있는 벤치마크 feedback에 대해. 우리는 일반적인 코딩 agent가 이 데이터 준비 loop를 자동화할 수 있는지 여부를 묻는다. 우리는 *Curation-Bench*라는 agent-centric

LLM PC 6월 4일

비주얼-어시스트드 매트릭스 문제 해결 벤치마크

arXiv:2606.04244v1 - 새로운 발표 요약: 다중 모드 대규모 언어 모델은 복잡한 추론 능력을 보유하고 있지만, 그들은 일반적으로 도구를 통해 문제를 외부화하고 도구의 출력을 바탕으로 추론할 때 성능이 저하되는 경향이 있다. 특히, 시각적 도움을 의존할 때 그렇다. 이 괴리는 실제 엔지니어링 및 과학적 워크플로가 분석, 유효성 검사 및 의사 결정에 시각화 도구를 의존하기 때문이다

에이전트 6월 4일

LLM이 협력하는 친구들을 만나보세요: SMAC-Talk

대규모 언어 모델(LLM)들이 점점 더 많이 사용되는 가운데, 다른 인공지능(AI) agent들과 함께 작동할 수 있도록 개발해야 합니다. 이러한 환경에서 효과적인 협력을 위해서는 agent들이 서로에게 정보를 공유하고, 불확실성을 감내하며, 의사결정을 내릴 수 있어야 합니다. 이를 위해, StarCraft Multi-Agent Challenge를 확장하여 자연어 처리(Natural Language Processing, NLP) 환경으로 변환한 SMAC-Talk을 개발했습니다. 이 환경에서는 agent들이 서로에게 정보를 공유하고, 의사결정을 내릴 수 있는 자연어 처리 채널을 제공합니다.

LLM PC 6월 3일

무조건 진행하는 에이전트? '안하고 있는 게 옳다'를 생각해 보라

인공지능 에이전트를 평가하는 기준은 주로 목표를 달성했는지 여부에 집중한다. 하지만 이 기준은 에이전트가 안전하게 행동할 수 있는 조건이 충족되었는지 여부를 고려하지 않는다. 에이전트는 인간의 feedback을 기반으로 학습하여, 조건이 충족되지 않았을 때도 진행하는 경향이 있다. 이를 '충성도 편향(compliance bias)'이라고 한다. 연구팀은 이 문제를 해결하기 위해 abstention-warranted scenario(안하고 있어야 하는 상황)의 세 가지 분류를 제시하고, abstention-aware 에이전트를 평가하는 새로운 지표를 제안한다.

에이전트 6월 3일

도움하는 것이 해를 끼치는 경우와 해결 방법: 다중-agent 논쟁을 위한 데이터 청소

다중_AGENT_ 토론이 데이터 청소에 도움이 되는지 hurt하는지 언제인지 알아보았습니다. 세 가지 벤치마크, 네 가지 모델 종류, 그리고 6,000 여 개의 태스크-조건 pair를 조사한 결과, 토론의 효과가 반전되었습니다. 모든 네 가지 모델 (-1.6에서 -15.5pp)에서 토론이 생성을 나쁘게 만드는 반면, 오류 감지를 개선했습니다 (+27.4pp F1, d=1.0). 토론의 이점

AI 모델 6월 3일

전자 의료 기록 표현을 대형 언어 모델과 일치시키기 위한 건강한 임상 판단의 기초

대규모 언어 모델(LLM)은 의료 결정 지원을 위한 강력한 자연어 논리 능력을 보이지만, 구조화된 장기 전자 의료 기록(EHR)의 효과적인 모델링에 어려움을 겪습니다. 반면, EHR 기반 모델은 예측 가능한 환자 표현을 학습할 수 있지만, 해석 가능한 언어 기반 논리를 제공하지 못합니다. 이 격차를 해결하기 위해, 우리는 구조화된 EHR 표현과 프리트레인된 LLM의 의미 공간을 연결하는 작업

AI 모델 6월 3일

행동트레이스에서 실제 사용자 결정을 모델링하는 행동벤치

Decision-support 시스템은 사용자별로 적응할 수 있어야 하는데, 이 문제를 위한 평가 데이터는 여전히 제한적이다. 사용자 이해를 위한 기존 벤치마크는 주로 시뮬레이션된 사용자나 모델이 생성한 행동에 의존한다. 하지만 최근 연구는 모델 기반 시뮬레이션의 경우 인간 행동과 체계적으로 다르다고 경고한다. 우리는 \textsc{BehaviorBench}라는 사용자별 의사결정 모델링을 평

인기 태그