본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 6월 2일

대규모 언어 모델의 상호 작용적인 추론 평가: 실행 가능한 게임을 포함한 계층적 기준점

논문 제목: 2606.00103v1 해석: 다단계 상호 작용 프레임워크를 제시하며, 이 프레임워크는 추론을 능동적인 증거 취득과 믿음 갱신으로 다루는 것을 목적으로 한다. 대규모 언어 모델(LLMs)은 작업 규칙만을 받으며, 숨겨진 환경에 타겟된 질문을 내보내고, 시간에 따른 부분 관찰을 통합하며, 최종 답을 제출할 때까지 결정해야 한다. 표준 성공률과 상호 작용 효율성 외에도, 제어된 문맥

에이전트 6월 2일

마인드게임즈 아레나 일반화 트랙: 시간 지연된 단계별 보상 할당을 포함한 인2AI 솔루션

어떤 행동의 품질은 미래의 사건에 의존하거나 게임 규칙을 위반하는 움직임에 의존하거나 다른 플레이어의 결정에 의존할 수 있으므로, 다중 agent 전략적 상호 작용을 위한 언어 모델 agent를 교육하는 것은 핵심적인 어려움을 제시한다. 표준 강화 학습은 각 단계마다 보상을 할당할 수 있다고 가정하지만, 이 가정은 시간과 agent 간의 결과가 얽혀 있는 설정에서 실패한다. 우리는 지연된 단

AI 모델 6월 1일

지식 그래프 추론을 위한 확산 모델을 이용한 그래프 형태의 규칙 생성

지식 그래프(KG) 추론에서 논리 규칙은 해석 가능성과 관계 패턴을 모델링할 수 있는 능력으로 지식 그래프의 기본적인 구성 요소입니다. 그러나 기존 규칙 탐색 방법은 단순한 chain-like 규칙에만 집중하고 그래프와 같은 구조의 richer 관계 정보를 무시합니다. 특히, 그래프와 같은 규칙은 탐색 공간의 combinatorial 폭발로 인해 계산적인 성능이 저하됩니다. 이 한계는 또한

에이전트 6월 1일

MAVEN: 의사소통 도구의 일반화 향상

대인간 논리 시스템의 신뢰성을 높이는 데 있어, 도구 호출 환경 간 일반화가 큰 과제로 남아 있다. 개별 벤치마크에서 강력한 결과를 달성하는 대규모 언어 모델(LLM)도, 논리 전략의 조합, 중간 상태의 보존, 도메인 간 도구의 조정 등에 대한 능력은 여전히 미흡하다. 우리는 MAVEN(Modular Agentic Verification and Execution Network)이라고 하는 가

에이전트 6월 1일

정책-코드 검색에서 전략적 제공자 반응에 따른 보건 기구 기구

건강 관리 기관의 전략적 제공자 반응은 건강 관리 기관 자체와 분리되지 않는다: 기존의 건강 관리 AI 벤치마크는 이러한 반응을 고정하고 있기 때문에 기관이 생성하는 균형에 따라 기관을 평가할 수 없다. 우리는 병원 기관 설계를 대규모 언어 모델(LLM) 기반 프로그램 합성으로 재구성한다: 형식화된, 검사 가능한 규칙 프로그램은 Medi-Sim이라는 다중-agent 시뮬레이터의 다섯 가지 전

AI 모델 6월 1일

LLMs를 활용한 임상 의사 결정에 대한 신뢰성 있는 EHR 기반 벤치마크

의료 결정-making( Clinical Decision-making, CDM)은 실제-world 의료 워크플로우에서 중요한 역할을 하며, 의사들은 불완전한 증거를 기반으로 진단을 추론하고 치료를 선택하거나 미래의 건강 결과를 예측한다. 대규모 언어 모델(LLM)은 강력한 언어 능력, 광범위한 생의학 지식, 효율성으로 인해 이러한 결정에 지원하기 위해 점점 더 많이 사용되고 있지만, LLM이

AI 모델 6월 1일

물리적으로 기반한 자연어로부터 다이어그램 생성

물리학 문제를 텍스트에서 다이어그램으로 생성하는 것은 물리 법칙을 엄격히 지키는 것을 요구한다. 현재 생성 모델은 시각적으로 가능성이 높은 출력을 생성하지만, 힘 벡터를 무작위로 생성하고, 보존 법칙을 무시하고, 기하학적 제약을 위반한다. 우리는 물리 법칙을 지키는 신경符号 pipeline인 PhyDrawGen을 제안한다. 먼저 대규모 언어 모델이 문제 텍스트에서 유형화된 장면 그래프를 추출

에이전트 5월 29일

호기심을 관리하는 대인격 AI, 중첩 학습 및 AI 지속 가능성에 대한 의미론적 캐싱

호기심은 대규모 언어 모델 시스템의 신뢰도에 대한 주요 장애물로, 특히 다중 agent pipe라인에서 지원되지 않는 주장들이 무제한으로 단계별로 전파될 수 있다. 이 연구에서는 Nested Learning 아키텍처를 대규모 언어 모델 시스템에 적용하여 호기심을 줄이는 새로운 방법을 제안한다.

에이전트 5월 29일

자연형 특성의 온톨로지 구축 지연을 극복하는 프런티어 LLM 기반 agent

비 텍스트 형태의 유전 특성 설명을 개체-품질(Entity-Quality, EQ) 어휘로 연결하는 것, 즉 유전 특성 어휘화는 비교 형태학적 데이터의 연구 간 통합을 위한 필수 과제입니다. 이 번역 작업은 매우 훈련된 전문가에 의해 수행되었기 때문에 대규모로 확장하기 어려우며 이는 주요 걸림돌입니다. Dahdul 등(2018)은 일곱 가지 계통학적 연구에 걸쳐 Entity-Quality 어휘

AI 모델 5월 29일

인지 범주형 트랜스포머: 범주론적 수학적 전제와 언어 모델링

인지 범주형 트랜스포머(Cognitive Categorical Transformer, CCT)는 대규모 언어 모델(LLM)인 GPT-2 Small의 백본에 범주론적 수학적 전제를 기반으로 한 지식 요소를 추가하여 언어 모델링 성능을 향상시킨다. CCT는 WikiText-103 데이터셋에서 21.27의 검증 퍼플렉스성(perplexity)를 달성하였으며, 동일한 조건하에 훈련된 GPT-2 Small의 baseline보다 2.92 PPL 감소가 기록되었다.

연구 5월 27일

지속 가능한 스킬을 위한 지역 동적regularity: 오프라인 계층적 강화 학습

오프라인 계층적 강화 학습에서 지속 가능한 스킬을 얻는 것은 여전히 열린 문제입니다. 연구팀은 지역 동적regularity를 활용하여 지역 전이와 전역 컨텍스트 간의 유사한 행동 시퀀스를 학습하여 지속 가능한 스킬을 재사용하는 데 도움을 주는 알고리즘 CARL(Contrastive Action-based Representations for Reusable Local Control)을 제안했습니다. CARL은 복잡한 인공인간 환경에서 의미 있는 스킬의 군집화를 보였고, OGBench 벤치마크에서 HIQL과 통합되었을 때 다운스트림 성능을 향상시켰습니다.

AI 모델 5월 27일

전지적 사고 능력 평가: LLM에서 명시적 신념 모델링을 통해 이론적 사고 능력 평가

마인드 리딩(Theory of Mind, ToM)이라는 것은 다른 사람의 지식, 의도, 감정 등을 추측하는 능력을 의미하는데, 이 능력을 대규모 언어 모델(LLM)에서 평가하는 데에는 종점 질문에 대한 답변을 통해 평가한다. 이 방식은 모델이 실제로 강력한 논리를 위해 필요한 내재된 정신 상태 표현을 구성하고 있는지 여부를 가려주고, 다른 사람의 의견이 달라지는, 변화하는, 또는 잘못된 의견

에이전트 5월 27일

Agent 성능 평가 생성에서 오류 편차를 완화하는 앵커

AI agent가 중요한, 장기적인 기업 업무 작업을 완료하기 시작했지만, 기업용 작업을 위한 훈련 및 평가 환경은 현실성, 검증 가능성, 규모를 균형있게 유지하는 데 어려움을 겪고 있다. 환경 및 작업 생성이 자주 artifact drift라는 실패 모드에 걸린다. 즉, 약하게 연결된 프로세스에서 지시문, 환경, 오라클, 검증기는 자주 작업이 필요한 것을について 동의하지 못하고, 불해결 가

에이전트 5월 27일

배치된 시스템을 위한 에이전트 수명 엔지니어링

인공지능(AI) agent가 장기적으로 운영되면서 운영 시스템으로 사용되면서, 여전히 초기화된 모델처럼 평가되고 있다. 첫 번째 운영일(day-one) 기준점은 시스템의 기본적인 질문을 놓치고 있다. 그 질문은 agent가 배포된 후 얼마 동안 신뢰할 수 있는 상태를 유지하는지다. 모델의 가중치가 고정되어 있어도, agent의 실제 상태는 계속해서 변하고 있다. 이는 agent가 상호 작용

AI 모델 5월 27일

제약 조건 수집의 기준을 높일 필요가 있다.

현재 도메인 지식 artifact에서 수학적 프로그래밍 모델(model)로의 제약 학습(Constraint Acquisition, CA) 및 관련 연구는 충분한 기준점의 부족으로 제한되고 있습니다. 이러한 결함은 재현성과 연구간 비교의 어려움으로 CA 방법의 성숙을 늦추고 있습니다. 기존의 기준점은 솔버 평가를 위한 것이었지만 CA 알고리즘을 평가하기 위한 것이었습니다. 또한 기준점은 구체적

인기 태그