본문으로 건너뛰기

#벤치마크

333개의 기사

에이전트 8월 6일

LLM agents를 위한 이론적 지식에 근거한 이벤트 기반 개인화된 기억 평가 지표

대규모 언어 모델(LLM)代理는 고위험 분야인 금융 상담 등에서 개인화된 보조원으로 점점 더 많이 사용되고 있지만, 여전히 장기 시야에서 개인화된 사용자 모델을 유지하고 업데이트할 수 있는지 불분명하다. 현재 개인화된 기억 측정 기준은 주로 사실적 기억력이나 약한 제약 조건에 의한 모델 생성 경로에 의존하여, 이벤트 기반 선호도 적응은 여전히 미흡하다. 우리는 FinPerMA라는 이벤트 기반

AI 모델 8월 6일

테이블에서 멀티모달 보고서 생성을 위한 몬테 카를로树 탐색

데이터 지능의 중요한 문제 중 하나는 구조화된 표 데이터에서부터 BOTH 텍스트 분석과 시각화 차트를 포함하는 전문적인 멀티모달 보고서를 자동으로 생성하는 것입니다. 현재 방법론은 고정된 선형 PIPELINE과 분리된 SUBTASK PROCESSING으로 인해 사실의 정확도, 시각적 품질, 그리고 논리적 일관성을 동시에 최적화하는 것을 방해하고 있습니다. 이러한 문제를 해결하기 위해, 이 논

에이전트 8월 5일

데이터 추적기: 인간과 같은 시간적 탐색이 행위적 액션 공간을 완성시킨다.

대규모 언어 모델이 자동으로 Verilog RTL 생성에 hứ부를 보여주었지만, 표준 벤치마크에서 최고 수준의 멀티 에이전트 시스템은 ~95% 정확도에 한계를 나타냈다. 우리는 이 한계를 완전한 디버깅 액션 공간의 부족으로 인한 것으로 추정한다: 기존 시스템은 에이전트가 검사할 수 있는 신호, 쿼리할 수 있는 시간 윈도우, 또는 둘 다를 제한하여 디버깅을 좁고 예측된 회로 동작의 패턴에 의한

에이전트 8월 4일

자기개선 가능한 LLM agent에서 메모리 보상 인플레이션

대규모 언어 모델(LLM) agent는 점차 경험을 통해 무거치하게 학습한다. 각 에피소드는 외부 메모리에 저장되어 점수를 받고, 이후 비슷한 미래 작업을 위해 재검색된다. 보상을 통해 보는 시점에서 저장된 점수는 암시적, 비파라미터 정책의 대리 보상으로 볼 수 있다. 각 재검색된 에피소드는 정책 개선 단계가 되며, 그 점수가 어떻게 생산되는지에 따라 신뢰도가 좌우된다. 배포 시, 정답 레이

AI 모델 8월 4일

지구 친화적인 지구 기반 LLM의 효율성: 소비자 하드웨어에 대한 초기 양적 GPU 전력 벤치마크

대규모 언어 모델(LLM)의 지역 배포는 개인 정보 보호의 우려와 기지 내 추론의 욕구로 인해 점점 더 심화되고 있다. 그러나 소비자 하드웨어에서 에너지 비용은 주로 정확도만 고려하는 대부분의 벤치마크로 인해 아직까지도 매우 불확실한 상태이다. 이 논문은 1B에서 7B 파라미터까지의 열 개의 오픈 소스 대규모 언어 모델이 하나의 소비자 GPU(RTX 4060Ti 16GB)에서 실행되는 하드웨

AI 모델 8월 3일

인공지능이 인공지능 과학자를 평가할 수 있나요? 자율 연구 생성 시스템을 위한 자동 멀티 모델 검토를 위한 벤치마킹 연구

AI 과학자 시스템이 자율 연구를 할 수 있는 잠재력을 가지고 있으면 과학적 발견을 크게 촉진할 수 있습니다. 그러나 AI가 생성한 논문의 질을 평가하고 비교하는 것은 여전히 열린 문제입니다. 우리는 과학 논문을 네 가지 핵심 dimension(원래성, 과학적 엄밀성, 명료성, 중요성)에서 평가하는 자동화된 peer-review 시스템을 사용하는 rigourous benchmarking pr

에이전트 7월 31일

물리 문제의 구조를 탐색하기: 인공지능 agent가 통계 물리적 매핑을 발견할 수 있을까?

이론 물리학에서 새로운 문제가 알려진 모델로 변환될 수 있는지 인식하는 능력은 중요한 능력입니다. 이 능력을 인공지능-AGENT의 과제로 연구하였는데, 대규모 언어 모델(LLM)-기반의 agent가 raw partition function에서 tractable representation으로 통계 물리학적 매핑을 발견할 수 있는지 여부를 확인하였습니다. 이 질문을 확인하기 위해, StatMec

AI 모델 7월 31일

코드 추적기: 설명 가능한 및 감사 가능한 코드 생성에 위치-키 Snippet 버전 관리

현대 대규모 언어 모델(LLM) 기반 코드 생성.agent는 코드를 블랙박스 형태로 출력한다. 각 라인의 근거는 숨겨져 있고, 벤치마크를 통해 코드가 수정되는 과정이 순간적이며, 후속 감사는 불가능하다. 우리는 다음과 같은 세 가지 상호 보완적인 기법을 통해 이러한 약점을 해결하는 코드 생성 개념을 제시한다. (i) 관계적 snipper-역사 스키마: 각 수정 이벤트마다 벤치마크 참조, 라운

에이전트 7월 31일

위치: 평가 점수는 지각할 수 있는 지식 주장

언어 모델의 평가 방법론은 자동화된 지표와 대규모 언어 모델(LLM)으로부터의 평점, 인간 평가 및 벤치마크_SUITE 결과를 결합하는 방식으로 점점 더 다양해지고 있습니다. 이러한 신호를 평균화하여 평가의 신뢰성을 크게 초과하는 phenomenon을 '평가 신뢰도 팽창'이라고 부릅니다. 우리는 평가 점수를 3가지 속성을 갖는 epistemic claims로 간주한다: formalite (인

AI 모델 7월 31일

AI 벤치마크의 추론 결합이 불충분한 문제: AI 평가에서의 프로젝트 가능성

AI 벤치마크 결과는 일반적으로 단일 단계에서 중요한 결론을 내리지 않습니다. 평가자는 결과를 다른 경우에 일반화하고, 그것을 능력의 증거로 해석하고, 새로운 작업에 그것을 확장하고, 다른 시스템이나 사이트로 그것을 이전하고, 인간 검토와 하위 결과에 대한 가정과 그것을 결합합니다. 유효성 중심 접근법은 각 주장에 대한 증거가 필요합니다. 이 연구는さらに epistemic 문제를 식별합니다: 하나의 연구의 대상이 다음의 원천이 아님을 의미합니다. 시스템, 집단, 결과 또는 조건은 인터페이스에서 변경될 수 있으며, 공유된 데이터 또는 모델 계통은 독립적인 지원이 의존적임을 나타낼 수 있습니다. 프로젝트 가능성은 관찰된 경우에서 관찰되지 않은 경우로의 한계 확장의 합당성에 대해 질문합니다. Goodman은 확장의 경쟁 문제를 제공하고, 논리 기반 유효성은 그것들을 검증하기 위한 구조를 제공합니다. 이 연구의 독특한 주장은 비합성 원리입니다: 인접한 프로젝션에 대한 지원은 끝점과 가정과 일치하고, 의존성과 불확실성이 전달될 때만 그들의 합성을 허용합니다.

에이전트 7월 31일

장기 의료 멀티모달 데이터 과학을 위한 장기 시각화 코딩_AGENT

클리니컬 데이터 사이언스 에이전트는 다차원 longitudinal 기록을 분석할 수 있는 신뢰할 수 있는 결과로 변환해야 하지만, 기존 벤치마크들은 주로 의료 질의응답, 구조화된 표 정리, 또는 일반 과학 데이터베이스만 다루고 있다. 우리는 CLINLENS라는 새로운 벤치마크를 소개한다. CLINLENS는 구조화된 전자 의료 기록, 의사소통 기록, 전기 심장 그래프, 흉부 방사선 사진, 그리

에이전트 7월 29일

크리스탈리스: 진화하는 결정화와 의미적 앵커링을 통한 협조적 다중 관점 시각화 생성

대규모 언어 모델(LLM)들은 개별 그래프를 생성할 수 있지만, 데이터 흐름을 공유하고 상호 작용하는 여러 시각화의 협調한 멀티뷰 시각화(CMV)는 아직도 도달하기 어렵다. 데이터 변환, 시각화 인코딩 및 상호 작용 조정 간의 밀접한 field-level 결합은 하나의 구성 요소의 오류가 조건부로 다른 구성 요소의 유효성을 무효화시킨다. 모델 능력, 도메인 지식 및 사용자 전문성에 의존하는

AI 모델 7월 29일

온라인 쇼핑몰에서 식료품 카테고리 추천 시스템

온라인 슈퍼마켓 쇼핑의 급속한 성장으로 인해 순환 구매 행동과 다양한 사용자 의도 캡처하는 추천 시스템이 필요하다. 전통적인 아이템 단위 방법은 확장성과 정확성 문제를 겪고 있기 때문에 카테고리 단위 추천은 더 구조화된 실용적인 대안으로 여겨진다. 우리는 실제-world 운영 환경에서 온라인 슈퍼마켓 카테고리 추천을 위한 고도fine-tuned 언어 모델인 GROCLM을 제시한다. GROCL

에이전트 7월 28일

자연스러운 한국어 번역: 인공지능 기반 양자 최적화 다중 agent 시스템으로 구성된 자율 양자 최적화 시스템: 단백질 구조 예측

arXiv:2607.22549v1 발표 형식: 새로운 논문 초록: 하이브리드 양자-클래식 프로틴 구조 예측은 해밀토니안 페널티 가중치에 강하게 의존하는데, 현재 일반적으로 사용되는 격자 기반 워크플로우에서는 이러한 계수들을 수동으로 고정하고 시뮬레이션에서 매우 짧은 프래그먼트만 평가한다. 우리는 QFoldAgent, 5-잔기 테트라하드 격자 접힘을 위한 닫힌 루프 다중 에이전트 프레임워크를

AI 모델 7월 27일

구조 인식과 텍스트 구조 통합을 위한 Benchmarks와 Auditable Reference Pipeline

스키마 그래프는 스키마에 기반한 정보 추출과 지식 그래프 구축의 상류 병목 현상입니다. 하지만 대부분의 추출 시스템은 스키마가 이미 존재한다고 가정합니다. 스키마를 구축하고 온톨로지 유도에 사용하는 PIPELINE인 SCOPE(스키마 구축 및 온톨로지 유도 PIPELINE 평가)를 소개합니다. SCOPE는 24개의 공개 정보 추출 소스(15개 RE, 9개 EE)에서 정제된 스키마 그래프로만

AI 모델 7월 27일

그래프 신경망에서 깊이-aware의 장거리 전파에 대한 스펙트럼 흐름 증명서

그래프 신경망( Graph Neural Networks, GNN )은 지역 메시지 전달을 통해 정보를 전달하지만 그래프 구조 자체가 장거리 작업을 해결하기 위해 어떤 양의 훈련도 해결하지 못하는 경우가 있다. 새로운 그래프에 GNN을 배포할 때, 현재 훈련이 시작되기 전에 그래프의 구조가 정보가 먼 노드 사이에 충분히 전달할 수 있는지 알 수 있는 inexpensive한 방법은 없다. 이 빈

에이전트 7월 24일

인페런스벤치: 인공 지능 요원에 의한 개방형 LLM 추론 최적화에 대한 벤치마크

연구와 개발 과제를 자동화하기 위해 점점 더 많이 사용되는 인공지능 agent는 현재의 벤치마크는 일반적으로 사전 정의된 워크플로우 또는 좁은 액션 공간에서 평가한다. навіть nominally open-ended task도 종종 잘 알려진 레시피를 검색하고 몇 가지 하이퍼 파라미터를 조정하여 해결할 수 있기 때문에, 강력한 결과가 실제 최적화인지 또는 memorized solution인

AI 모델 7월 24일

자율 TPU kernel 최적화 성능 측정 도구: JAXBench

AI 모델이 생성한 GPU 커널 최적화에 대한 구글 클라우드 TPU를 위한 새로운 벤치마크套件을 제시합니다. JAXBench는 50개의 JAX 작업을 포함하며, 최적화를 위한 여유를 제공하는 동시에 관련성이 있습니다. 이 벤치마크套켓에는 17개의 실제 ML 연산자와 33개의 KernelBench에서 검증된 연산자가 포함됩니다. 이 중 8개의 연산자는 Tokamax의 공개 라이브러리에서 제공하

AI 모델 7월 24일

LLM의 변동성은 지식의 깊이를 드러내지 않는다: 온도 변동성과 모델 다양성의 차이점

대규모 언어 모델(LLM)의 반복 실행에서 다른 답변을 얻을 때, 그 변동성은 모델이 모르는 것을 드러내는 것일까? 자기 일관성은 다수 투표를 통해 변동성을 질문별 불확실성 추정치로 변환시킨다. 그러나 변동성은 다중 모델의 다양성과 같은 관련 질문이 함께 변동하는 구조를 드러내는 것일까? 우리는 동일한 질문에 대해 두 가지 방식을 비교한다: 하나의 모델을 100번 실행하는 것 versus 24개의 LLM을 한번씩 실행하는 것. 마르첸코-파스트루(random-matrix) 테스트는 두 가지 경우 모두 신호와 샘플링 잡음 사이를 분리한다. 단일 모델 내에서, 최대 5개의 가족과 3개의 벤치마크(MMLU, HellaSwag, GSM8K)에서 noise edge를 넘는 차원이 하나 이상 존재할 수 있다. 그러나 다중 모델 집합 내에서, 4개의 고유값이 noise edge를 넘어간다. 이는 matched-difficulty Bernoulli null에서 500회 Monte Carlo 추출 중에서 1회에 해당하는 확률이다. 자기 일관성은 질문별 정확한 불확실성 추정치를 제공하지만, 관련된 질문이 함께 변동하는 구조는 드러나지 않는다. 다중 모델 집합만이 모델이 모르는 것을 드러낼 수 있다.

AI 모델 7월 23일

LLM agent를 위한 프로파일 그래프 메모리: 내재된 엔터티 간 전이의 이야기 프로필을 통해

장기 기억은 세션 간 상호 작용하는 LLM agent에 필수적이나 현재 기억 평가 지표는 주로 단일 hop recall를 평가하며, 다중 hop 연관은 거의 측정되지 않았다. 우리는 세 가지 contribution을 제시한다. 첫째로, 우리는 MemHop이라는 다중 hop 기억 평가 지표를 1,000 개의 질문과 hop 깊이 1-5, 10 개의 사회 네트워크 시나리오를 포함하여, per-ho

에이전트 7월 23일

도구 사용하는 LLM agent의 구조화된 런타임 안전성: NEXUS

대규모 언어 모델(LLM) 에이전트가 점점 더 큰 영향을 미치는 행동을 수행하기 때문에 실행 중 안전성을 감시하는 것이 필수적이 되었다. 우리는 NEXUS (Neural EXecution Utility and Safety)라는 구조화된 계획 안전 모니터를 제시한다. NEXUS는 공식적인 조치 정책을 적용하여 네 가지 행동 중 하나를 선택할 수 있다: 허용, 차단, 확인 요청, 또는 수정 요청

인기 태그