본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 7월 10일

의료 판단을 위한 LLM에 대한 연구: 임상 요구와 인공지능 기능을 조화시키는 조사

대규모 언어 모델(LLMs)은 의료 분야에서 중요한 도구로 떠올랐으며, 임상 판단력과 환자 관리에 대한 성장하는 잠재력을 보이고 있다. 이 조사에서는 최근 의료 대규모 언어 모델의 진행을 조사하며, 논리적 사고를 위한 응용 프로그램과 요구 사항에 중점을 둔다. 우리는 임상 실무와 계산적 방법론을 연결하는 이중 시각적 접근 방식을 제시한다. 임상 분야에서, 우리는 밀러 피라미드에 따라 지식 회

산업 7월 9일

신호와 잡음의 구분: 코드 평가에 대한 새로운 분석

OpenAI의 새로운 분석은 인기가 있는 코드 벤치마크인 SWE-Bench Pro에 문제가 발생하여 AI 모델 평가의 신뢰성과 정확성에 대한 우려를 제기합니다. 코드 평가에서 신호와 잡음을 구분하는 것은 AI 모델의 성능을 정확하게 평가하는 데 중요합니다. 신호는 코드 평가에서 의도한 결과를 의미하는 반면, 잡음은 코드 평가에서 의도하지 않은 결과를 의미합니다.

LLM PC 7월 9일

컴팩트 월드 모델에 공간 관계를 기반으로 하여 지시 정보 누출과 목표가 없는 동역학 수정

구체적인 월드 모델이 언어 목표에 대해 조건화된 경우, '빨간 블록을蓝색 블록의 왼쪽에 놓다'와 같은 관계를 구체적인 '참조 앵커'를 사용하여 구체적인 세트로 표현할 수 있다고 약속합니다. 우리는 이러한 참조가 실제로 관계를 구축할 때 언제 발생하는지 물어보고, 다음의 함정에 부딪히게 됩니다: 목표 조건의 예측기가 놀랍도록 0.90의 관계 읽기 정확도를 달성하지만, 이는 '인스트럭션 전사'가

에이전트 7월 9일

SageMath-증강 LLM agent를 사용한 계산 및 실험 수학의 평가

수학 분야에서 AI를 이용한 최근 성과는 주로 자동 공식화와 정리 증명에 집중되어 왔다. 그러나 대규모 언어 모델(LLM)에서 컴퓨터 대수 시스템(CAS)의 역할은 아직 충분히 연구되지 않았다. 우리는 SageMath에서 얻은 검증 가능한 feedback와 Context7의 최신 문서를 결합한 ReAct-style 대인적인 설정을 제안한다. 또한 RealMath 벤치마크에서 연구 수준의 수학

에이전트 7월 9일

코딩 에이전트 평가를 위한 생산성 평가 경로 검토: AgentLens

AgentLens라는 대규모 언어 모델(LLM) 평가 도구를 제시합니다. 일반적으로 코드 에이전트 평가 도구는 단일 비트로 평가되지만(작업이 성공했는지 여부), 실제로 이러한 에이전트를 사용하는 사람들은 에이전트가 명령을 따르는 방식, 도구를 사용하는 방식, 자신의 작업을 검증하는 방식, 오류를 복원하는 방식, 사용자와 대화를 하는 방식에 대한 모든 경로를 경험합니다. AgentLens는 이

에이전트 7월 8일

리더보드 너머: 대형 언어 모델 agent의 도구 사용, 계획, 논리적 오류 통합

대규모 언어 모델(LLM) 에이전트는 점점 더 자신의 도구를 사용하는 능력, 다단계 작업을 계획하는 능력, 다른 에이전트와 협력하는 능력, 그리고 장기간의 시야를 갖는 능력에 대해 평가되고 있습니다. 보고된 벤치마크 향상은 종종 다른 평가 활동에 기록된 반복적인 실패 모드를 가려두고 있습니다. 이 연구는 27개의 벤치마크, 분류, 감사 논문(2023-2026)을 종합하여 에이전트의 한계를 설

에이전트 7월 8일

산업급 수준의 CAD_AGENT : 전문가 지식 distillation 기반의 전문 지식 distillation

산업 제품의 컴퓨터 aided design(CAD)가 필요로 하는 대규모 언어 모델(LLM)로 인한 절차적 모델링, 강력한 특성 의존성, 편집 가능한 기하학적 파라미터, 및 B-Rep 실행의 생산급 성능은 현재의 텍스트를 CAD로 변환하는 방법들이 promise한 진전에도 불구하고, 사용자 지시가 모호하거나 미약하거나, 또는 고급 디자인 의도만 설명한 경우에는 여전히 어려움을 겪고 있다. 또

에이전트 7월 8일

장편 소설을 위한 Narratology에 기반한 이야기 세계 모델: Story Writer 기억

장편 소설 작가들은 기억이 진화하는 이야기 상태에 대한 다중 점프 질문에 답해야 합니다. 예를 들어, 어떤 이는 비밀을 알고 있었고 그 비밀을 언제 알게 되었는지, 사건이 누군가의 비밀을 드러내는 설명보다 이전에 일어났는지, 설정이 성공적으로 끝났는지, 어떤 이는 관계가 어떻게 변했는지. 일반적인 정보 추출 시스템과 agent-memory 시스템은 entity와 fact를 표현하지만 narr

AI 모델 7월 8일

자동 CAD 생성을 위한 기초 모델

최근 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)의 발전으로 자연어 설명으로부터 매개변수 3D 디자인을 자동으로 생성할 수 있게 되었습니다. 이 장에서는 CAD 디자인의 자동 생성을 위한 기초 모델에 대한 경험적 연구를 제시하며, 97개의 엔지니어링 디자인 문제를 포함하는 고유한 평가 PIPELINE과 커밋된 벤치마크를 사용합니다. LLMForge라는 다중 모델 텍스트- CAD 프레

AI 모델 7월 8일

블록 기반 프로그래밍을 위한 작은 언어 모델을 튜터로 사용하는 벤치마크

대규모 언어 모델(LLM)이 교육자 역할로 사용되는 것은 점점 더 연구되고 있지만 K-12 교육 환경에서 이를 배치하는 것은 개인 정보 보호, 비용, 특허 모델에 의존하는 문제를 일으킨다. 작은 언어 모델(SLM)은 훌륭한 대안을 제공하지만 특정 교육 환경에 적합한 모델을 선택하는 것은 여전히 어려운 문제이며, 대상 도메인인 블록 기반 프로그래밍과 같은 경우 모델 훈련 데이터에서 크게 부족하

에이전트 7월 7일

예측 시장 agent의 믿음-to-거래 layer : 미래 예측을 넘어서

미래 사건을 예측하는 것은 일반적인 인공지능의 테스트베드로써 관심을 끌고 있는 분야입니다. 이 평가를 기반으로 하는 자연스러운 방법은 모델이 예측 시장에서 거래를 하게 하는 것입니다. 거래는 단순히 예측을 하기만 하는 것보다 더 많은 요구사항이 필요합니다. 최근 벤치마크에서는 조정된 확률 점수를 거래 결과와 큰 차이로 보고하고 있습니다. 우리는 Raven-Agent를 제안하고 있습니다. 우리

AI 모델 7월 7일

과학 연구를 위한 일반 용도 복제 도구 개발을 위한 VERITAS 방향

AI 도구가 과학 연구 출판을 가속시키면서 연구를 검토하는 시스템이 이를 따라잡기 어렵게 만들었고, 출판된 연구에 대한 independent 검증이 더 어려워지고 중요해졌다. 수동적으로 연구를 재현하는 것은 느리고 비용이 많이 들기 때문에, 코드 에이전트를 사용하여 프로세스의 일부를 자동화하는 작업이 점점 더 많아지고 있다. 기존의 노력은 주로 벤치마크와 그에 동반하는 에이전트로 구성되어 있

에이전트 7월 7일

의학 계산의 복잡성을 해결하는 LLM agent를 사용한 MedCalc-Pro

현재 의료 계산을 위한 대규모 언어 모델(LLM)의 평가 기준은 단순화된 환경에서 대부분 기반을 두고 있습니다. 이 환경에서 각 환자 사례는 단일 계산기와 명시적으로 지정된 계산기를 요구하는 질의로 대응합니다. 그러나 실제 임상 상황에서는 종합 평가, 계산기 중첩 계산, 및 목표 계산기를 직접 지정하지 않는 부드러운 질의가 필요합니다. 이를 위해 우리는 새로운 의료 계산 벤치마크, MedCa

AI 모델 7월 3일

분산 확산 언어 모델: 의료 라디올로지 보고서 초안 작성

의료 라디올로지 보고서 초안 작성을 위한 새로운 기술이 개발되었습니다. 분산 확산 언어 모델(DiffusionGemma-26B)은 의료 시각적 질문 대답 데이터셋에서 자동 회귀 모델(Gemma-4-26B)과 경쟁력을 뽐냈습니다. 분산 확산 언어 모델은 보고서 작성 속도가 3.5-4.4배 빠르며, 자동 회귀 모델이 제공하는 것과는 달리 보고서의 중간 부분을 채우는 기능을 제공합니다.

에이전트 7월 1일

자율 AI agent의 행동을 관리하는 증명 가능한 규칙을 위한 시스템

인공지능(AI)代理가 인간의 대표로 중요한 행동을 수행하는 경우가 점점 더 많아지는데, 이 행동에는 금융 거래, 외부 커뮤니케이션, 기업 워크플로우 등이 포함된다. 현재代理기반 인프라는 식별 연합(ID federation)과 위임 인증(Authorized delegation)을 통해 로드의 인증과 자원 접근 제어를 수행하지만, 현재의 행동 및 운영 환경에서 허용된 행동을 결정할 수 없다. 우

에이전트 7월 1일

퍼트리얼 관찰 하의 멀티 에이전트 강화 학습에서 하이퍼 프로퍼티를 활용한 하이포레: Hyperproperty-Guided Multi-Agent Reinforcement Learning under Partial Observation

Formal 명세는 학습 과정에 대한 강력한 도구로, 보상 형성보다 다음과 같은 이점을 제공한다: 1. 수학적 엄밀성 2. 목표와 제약을 지정할 수 있는 표현력 3. 목표 달성을 위한 전략을 정의할 수 있는 능력 그러나 Multi-Agent Reinforcement Learning (MARL)에서 이러한 이점은 주로 탐구되지 않았다. 이 논문에서는 Partial Observability 하에

에이전트 7월 1일

전문 사용자 이외의 사용자를 위한-agent는 사용자의 선호도를 구축하는 데 도움을 주어야 하며, 그 선호도를 단순히 추출하는 것만으로는 부족하다.

인터랙티브 에이전트가 사용자와 협력하여 사용자가 원하는 것을 구체적으로 표현할 수 있도록 도와주는 시스템은 현실적인 상황을 가정하지 않는다. 사용자는 종종 특정 특성에 대한 선호도를 결정하기 위해 필요한 도메인 지식을 갖고 있지 않으며, 사용자가 특정 특성에 대한 선호도를 묻는 경우, 에이전트가 사용자에게 도메인 지식을 알려주거나 예시를 제공하여 사용자가 선호도를 결정할 수 있도록 도와주면

인기 태그