본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 7월 23일

대형 언어 모델에서 정보 판단

기존의 검색 엔진을 대체할 대규모 언어 모델(LLM)은 인터넷과 같은 외부 지식 소스를 사용하기도 한다. 이 모델들이 정보를 적절히 가중치로 부여하며, 신뢰할 수 있는 소스를 더 많이 고려하고 (소스 판단력) 진실한 정보가 더 가까워질 때 claim을 더 많이 업데이트 하는가? 우리는 이 문제를 정보 판단력으로 정의하고, 세 가지 명제적 원칙에 기반한 interpretable metrics를

LLM PC 7월 23일

인텔 TDX 하위 NVIDIA H100에서 신뢰할 수 있는 GPU 추론 성능 측정

기밀 처리는 sensitive한 입력을 처리하거나 사설 모델 자산을 보호하기 위해 AI 인식 작업을 위한 실질적인 배포 요구 조건이 되고 있습니다. 그러나 GPU 가속된 대규모 언어 모델 서비스를 위해 기밀 처리를 활성화하는 성능 비용은 작업 부하에 따라 달라지고 operationally 중요합니다. 이 논문은 NVIDIA H100 80GB GPU를 Intel TDX 기밀 인스턴스에 호스트한

에이전트 7월 22일

LLM 기반의 다중 agent 시스템에서 contribution attribution에 대한 협동적 의미적 게임

LSTM 기반 다중 agent 시스템에서 최종 출력은 여러 agent, 메시지 교환, 순서에 의한 workflow 의존성으로 생성된다. 현재의 attribution 방법은 대개 counterfactual valuation을 통해 agent를 제거하거나 score의 변화 비교를 통해 agent 서브셋의 변화에 따른 score의 변화를 분석한다. 그러나 이러한 방법은 repeated model

AI 모델 7월 22일

MILP-Evo: MILP 해결기 자동 설계

대규모 언어 모델(LLM)을 이용한 밀린터 선형 프로그래밍(MILP) 솔버 논리는 데이터 주도 정책이 MILP 솔버를 가속화 할 수 있음을 보여주었지만, 많은 이러한 접근 방식은 학습된 정책이 외부 예측기나 다른 불투명 모델로 표현되기 때문에 검사, 적응 및 배포가 어려울 수 있습니다. 반면에 명시적 솔버 논리는 더 쉽게 이해하고 통합 할 수 있지만 보통 학습이 아닌 솔버 피드백으로부터 직접

LLM PC 7월 22일

Phionyx: 결정론적인 AI 런타임 아키텍처에 구조화된 상태 관리 및 전 처리 정부를 지원하는 시스템

연구자들은 Phionyx라는 이름의 새로운 AI 런타임 아키텍처를 제시했다. Phionyx는 Echoism 상호 작용 프레임워크의 확장 버전으로, AI 엔지니어링에 '통치'를 우선시하는 접근법을 도입한다. Phionyx는 확률적 agent와 달리, 확률적 상태 전진 방정식에 의해 지배되는 구조화된 상태 벡터를 사용하여 확률적 상태 전진 방정식을 사용하지 않고, 결정론적 상태 전진을 강제한다.

에이전트 7월 22일

구조화된 agent 평가 및 근거付け

대규모 언어 모델(LLM)의 에이전트 호출 평가에서 정확도만을 고려하는 것은 다양한 실패 모드의 차이를 가려버린다. 모델이 올바른 함수를 선택했더라도 인자 값을 허구로 만들거나, 스키마를 만족하면서도 잘못된 이유로 에이전트를 선택할 수 있다. 기존 벤치마크는 이러한 차이를 단일 이진 점수로 압축하기 때문에, 실무자들은 에이전트 호출이 실패하는 곳을 진단할 수 없다. 우리는 SAAG이라는 연쇄

연구 7월 22일

대규모 AI 도구 발견: 모든 것이 DNS에 있다

인공지능(AI)_AGENT가 자율적으로 작동하는 시대가 다가오고 있습니다. 이러한 자율 AI_AGENT를 위한 발견 메커니즘은 수백만 개의 도구를 탐색할 수 있어야 하지만, 현재의 해결책은 O(N) 복잡도와 중앙집중화된 통제를 가지고 있기 때문에 무너집니다. 또 다른 취약한 Overlay를 구축하기 보다는, 우리는 도메인 이름 시스템(DNS, Domain Name System)을 Intern

AI 모델 7월 22일

시스템 관리자: 전위 AI에서 권력 추구 행위 측정

AI 시스템이 과제 요구 사항을 넘어 리소스를 획득하거나 감독을 피하거나 중지에 저항하는 행동을 구현하는 것을 '권력 추구'라고 정의하고 있습니다. 이 연구에서는 SysAdmin이라는 벤치마크를 제시하여 프런티어 언어 모델을 고도로 신뢰할 수 있는 리눅스 샌드박스 내에서 자율 시스템 관리자로 위치시켜서 5가지 차원(자신을 보호하기, 자율성을 증가시키기, 리소스를 획득하기, 환경을 수정하기,

AI 모델 7월 21일

작은 언어 모델을 사용한 인공지능 민주화: 지역 배포를 위한 구조화된 벤치마킹 및 매개 변수 효율적인 tinh회정

인공지능 민주주의는 주로 대규모 언어 모델의 일반성을 맞추는 문제가 아니고, 대규모 언어 모델(LLM)가 하드웨어와 관리 제약으로 인해 일반 기관이 만족할 수 있는 범위 내에서 선택, 감사, 분산되도록 할 수 있는 문제입니다. 본 논문은 135M에서 3B 파라미터까지의 9개의 오픈-웨이트 언어 모델이 1,085 개의 예시와 16 개의 주제를 가진 다중 선택 시험지에 대한 구조화된 지역 배포를

AI 모델 7월 20일

MLLM-유도 diffusian 변환기와 관계 적응 혼합 전문가 모델을 이용한 다모드 지식 그래프 완성

Multimodal 지식 그래프 완성(Multimodal Knowledge Graph Completion, MKGC)은 구조적, 텍스트, 시각적 단서에서 누락된 엔터티를 추론하는 것을 필요로 한다. 기존의 확산 기반 MKGC 방법은 일반적으로 raw multimodal 특징에 직접 노이즈 제거를 한다. 이러한 디자인은 관계에 의존하는 단서 선택, 교차 모드 의미 부합, 구조적 엔터티 생성을

AI 모델 7월 20일

건설 도면에서 다중 깊이 시각-문서적 추론을 위한 실제 세계 벤치마크: DrawingVQA

DrawingVQA라는 새로운 벤치마크를 소개합니다. 이 벤치마크는 대규모 언어 모델(LLM)들을 실세계의 건설 도면에 대한 멀티 모달 평가에 사용하기 위해 설계되었습니다. 건설 도면은 건축, 토목, 그리고 여러 다른 공학 분야에서 핵심적인 미디어입니다. 자연 이미지나 스키마틱 플랜과 달리, 건설 도면은 추상적인 기하학, символ 표기법, 표 형식의 데이터, 주석, 그리고 특정 분야의 텍

에이전트 7월 20일

Cure 1T: 의료 서비스에 특화된 주도적 건강관리 모델

건강 관리는 고위험 의사소통, 전문가의 사고력, 업무 처리를 포함한다. 그러나 이러한 용도를 모두 다룰 수 있는 특화된 대규모 언어 모델(LLM)은 아직 많이 없다. 건강 관리 모델은 환자 상담, 텍스트와 이미지에 대한 임상 사고력, 상호 작용 진단, 전자 의료 기록(EHR) 도구 사용을 처리해야 한다. 이러한 기능은 서로 다른 방식으로 실패하고, 한 업무를 위한 좁은 업데이트는 다른 업무를

에이전트 7월 17일

작은 언어 모델의 논리적 이해력을 높이는 방법

작은 언어 모델(SLM)은 대규모 언어 모델(LLM)와 비교하여 환경적으로 친화적이고 비용이 저렴하지만, 복잡한 논리적 이해력을 요구하는 작업에서 오류가 발생합니다. 본 연구에서는 SLM의 논리적 이해력을 높이기 위해 심볼릭 트리플릿 추출과 전문가의 논리적 추론을 위한 관계 그래프卷积 네트워크(RGCN)를 활용하는 방법을 제시합니다.

AI 모델 7월 17일

대화식 시각적 장소 인식 방향으로의 대화

인간이 공간 정보를 주고받는 방식으로 영감을 받아 공간 정보를 주고받는 언어 기반의 지리적 위치 식별이 직관적이고 실용적인 가치로 인해 큰 진전을 이루고 있습니다. 그러나 이러한 진전에도 불구하고 대부분의 방법은 정적이고 한 번의 검색만을 지원하는 패러다임에 기반을 두고 있으며, 이는 실세계 자연어 설명의 불명확성과 불완전성을 처리하지 못합니다. 우리는 새로운 패러다임으로 검색을 재단하고 대

AI 모델 7월 16일

LLM Chain-of-Thought를 위한 블랙박스 전제문 의존성 테스트: 개입적 바닥감 지진 검사

대규모 언어 모델(LLM)은 논리적으로 정당해 보이는 chain-of-thought(CoT) 추론을 생성하지만 실제로 주어진 전제에 의존하지 않을 수 있다. 우리는 개입적 인 지지審査(interventional grounding audits)를 소개한다. 이는 전제에 대한 단일 개입을 통해 대상 술어를 새로운 символ로 대체하고 모델을 재실행한 후 각 추론 단계의 정규화된 결론(norma

AI 모델 7월 15일

대화형 에이전트의 다차원 평가를 위한 운영화: 선택적 재평가 및 모델 벤치마크를 포함한 규제된 확장 가능한 pipe라인

retail 대화 요원 평가를 위해 단순한 단어 일치 지표 외에 의도 일치, 사실성, 도움, 명확성, ton, 및 전체 응답 품질을 평가하는 방법이 필요합니다. LLM-as-a-judge 방법은 인간 평가에 대한 대규모 대안을 제공하지만, 생산 배포는 통치, 재현성, 비용, 스키마 일관성, 추적성, 및 신뢰성과 같은 문제를 제기합니다. 우리는 GenAI Evaluation, 대규모 retia

AI 모델 7월 15일

GRID: 기업용 SQL 생성을 위한 문법 기반 디코딩 기술

SQL을 작성할 수 있는 대규모 언어 모델(LLM)이 있지만, 실무 환경에서 더 많은 요건이 필요합니다. 출력 결과는 문법적으로 올바른 결과여야 하고, 역할별 및 스키마별 정책을 준수해야 하며, 증명 가능한 보증이 필요하며, 생성이 증가할수록 속도가 느려지지 않아야 하며, 모든 결정에 대한 준수도준의 기록이 남아야 합니다. 우리는 GRID(Grammar-Railed Decoding), 문법

AI 모델 7월 14일

코세트 이전 스코어 세트: LLM 벤치마크 평가-무 감독 프롬프트 서브셋 선택

연구팀은 LLM 벤치마크 코세트 선택에 대해 연구했는데, 이는 작은 프롬프트 서브셋을 여러 벤치마크에 걸쳐 선택하여 전체 벤치마크 셋에서 얻은 모델 점수 및 순위를 근사하는 것이다. 연구팀은 평가-무 감독 벤치마크 코세트 선택 방법을 제안했는데, 이 방법은 모델 평가 결과를 사용하지 않고, 미세한 단계로 여러 벤치마크에 걸쳐 프롬프트 서브셋을 선택하는 것이다.

연구 7월 14일

그래프 엣지 스파리피케이션을 이용한 TSP

대규모 여행 판매 문제(TSP)의 정확한 해결은 계산 비용이 많이 듭니다. 연구자들은 계산 효율성을 높이기 위해 그래프 스파라시피케이션 방법을 사용합니다. 전통적인 스파라시피케이션 방법은 일반적으로 고정된 가이드라인에 의존하고, 인스턴스에 특화된 구조 정보를 완전히 활용하지 못합니다. 본 논문에서 우리는 그래프 에지 스파라시피케이션(GES) 방법을 제안합니다. 이 방법은 유계적 TSP에 대한

에이전트 7월 14일

자연어 상황에서부터 강건하고 검증 가능한 결정을 위한 YUKTI: 불확실성 유형의 제안 IR, 가정 강건한 파레토 경계, 그리고 부러움 증명서

연구자들은 대규모 언어 모델(LLM)과 같은 모델들이 단일 목표에 집중하여 숫자로 된 계획을 만드는 것을 주로 사용하지만, 이러한 모델들이 실질적인 예산, 노력, 또는 임상 주의를 할당하는 결정을 위한 신뢰도는 실패 모드이다. 이는 모든 개체화된 숫자가 가정이며, 정확히 맞지 않는 경우에만 최적화된 계획이 약한 것이기 때문이다. YUKTI는 이러한 문제를 해결하기 위해 자동 형식화의 목표를

에이전트 7월 13일

장기 임상 의사 결정에 대한 의료-agent의 성능 평가

arXiv:2607.09322v1 발표 본 연구에서는 실제 병원 기록(EHR)에 기반한 장기 시야의 의료 결정-making을 위한 LongMedBench라는 새로운 benchmark를 제시합니다. 이전에 LLM 기반 의료 agent를 평가한 연구는 주로 단기 맥락에 기반한 지식 QA와 도구 사용에 중점을 두었습니다. 그러나 실제 의료 치료는 장기적으로 진행되며, 임상가들은 반복적인 방문, 테

AI 모델 7월 13일

진짜 세계의 의료 멀티모달 벤치마크: 중국 온라인 의료 상담

대규모 언어 모델(LLM)들이 점점 더 많이 온라인 의료 상담에 도입되고 있지만, 현재까지의 벤치마크들은 실제 의료 실무와 잘 맞지 않는다. 많은 벤치마크들은 합성 대화나 환자 시뮬레이터를 사용하거나, 환자 업로드 한 의료 사진을 무시하거나, 다중 선택 또는 의미적 겹침 지표를 사용하여 개방된 의료 응답을 평가한다. 이는 의료 질을 잘 반영하지 못한다. 우리는 진정한 세계의 멀티모달 온라인 의료 상담을 위한 대규모 벤치마크인 **MedRealMM**을 소개한다. MedRealMM은 전국 중국 인터넷 병원에서 수집한 비식별 환자-의사 상호 작용을 사용하여 멀티모달 온라인 의료 상담을 위한 벤치마크를 구축한다. MedRealMM은 멀티모달 의료 문제 해결 지점(MCCP) 추출 Framework를 사용하여 진정한 상담 경로에서 의료적으로 요구되는 순간을 식별하고, 이전 텍스트-이미지 컨텍스트를 보존하는 동안 각 순간을 표준화된 다음 응답 생성 과제로 변환한다. 각 인스턴스는 의사들이 정제한 경우별 규칙을 사용하여 환자-의사 상호 작용을 평가한다. 현재 릴리즈에는 5,620개의 진정한 세계의 멀티모달 사례가 포함되어 있으며, 64개의 의료 부서를-spanning한다. 우리는 19개의 일반 목적 및 의료 전문 LLM, 텍스트-이미지 시스템을 포함하여 LLM을 평가한다. 결과는 이미지 정보가 신뢰할 수 있는 의료 성능을 보장하는 데 중요하며, 현재 최첨단 모델들이 온라인 의사 응답을 만족시키지 못한다는 것을 보여준다.

에이전트 7월 13일

장기 목표 지표 벤치: 장기 목표 지표를 위한 분자 보상 평가를 위한 agent의 한계를 시험하는

인공지능 agent는 짧고 명확한 작업을 자율적으로 완료할 수 있게되었습니다. 그러나 현재의 종결 벤치점은 간단한 문제에 초점을 맞추고 1분 이내에 완료되며, 최종 결과만 평가하는 것이 일반적입니다. 이러한 설정은 중간 진행과 부분적인 해결책을 무시하고, 희박한 보상 신호와 agent의 능력을 완전히 이해하지 못하게 합니다. 장기 목표 지표 벤치를 통해, 우리는 9개의 카테고리 (실험 재현, 소프트웨어 공학, 멀티 모달 분석, 인터랙티브 게임, 과학적 계산)로 구성된 46개의 장기 목표 지표 작업을 소개합니다.

인기 태그