본문으로 건너뛰기

#벤치마크

333개의 기사

연구 6월 30일

비전-언어 모델의 테스트 시간 적응을 위한 보완 메모리 시스템: ComMem

시각-언어 모델(Vision-Language Models, VLMs)의 강력한 배포를 위해 테스트 시간에 적응(Test-time adaptation, TTA)이 필수적이다. 그러나 기존의 TTA 방법들은 대개 시간에 걸쳐 지식을 축적하거나 단일 모드 내에서 작동하는 경우가 많아 시각-언어 모델의 내재된 다중 모드 특성을 활용하지 못한다. 생물학적 뇌의 보완적 기억 시스템을 참고로 하여, 우리

AI 모델 6월 30일

논리적 추론에서 진실을 찾기: LLM 경로를 조정하기 위한 동적 편집 프레임워크

현재 대규모 언어 모델(LLM)의 논리적 추론을 향상시키기 위한 접근 방식, 예를 들어 Chain-of-Thought와 "Wait" 지시어는 모델이 더 많이 생각하도록 유도하지만 종종 진실로 가도록 안내하지 못한다. Representation Editing(RepE)는 내재된 제어를 제공하지만 동적 추론 경로에 대한 응용은 아직 미흡하다. 이 연구에서는 추론 경로가 펼쳐질 때 진리의 기하학을

LLM PC 6월 30일

다중 모드 LLM의 이미지 기반 의료 대화에 대한 벤치마크

최근 대규모 언어 모델 및 시각-언어 모델의 발전으로 다중 모드 데이터에 대한 논리적 추론이 가능해졌고, 의료 적용 분야에서 의사결정 지원 및 전문의로의 분류와 같은 기회를 제공하고 있습니다. 그러나 현재 의료 AI 벤치마크는 분산되어 있습니다: 일부는 다중 턴 대화 지원을 제공하지만 이미지를 제공하지 못하고, 다른 벤치마크는 다중 모드 입력을 제공하지만 단일 턴 QA 작업에만 집중하고 있습

에이전트 6월 30일

GPTNT: 실시간 멀티모달 agent 간 협업을 위한 'Keep Talking And Nobody Explodes' 벤치마크

인공지능이 인간이나 다른 인공지능과 협력하여 작업을 수행하는 데 사용되는 다중 모드 모델의 사용이 점점 증가하고 있습니다. 현재 기준의 벤치마크는 이러한 모델이 여러 구성 요소의 능력을 갖추고 있음을 보여주지만 협력 시 발생하는 시간 압박, 정보 비대칭성 및 불완전한 통신과 같은 조건은 일반적으로 분리된 상태에서 연구됩니다. 우리는 협력하는 두 개의 agent가 반응 시간 내에 생성된 폭탄

AI 모델 6월 30일

모델 능력 향상 Closed-Loop 데이터 및 평가

대규모 언어 모델(LLM)의 전반적인 변수인 모델 능력은 직접 관찰되지 않습니다. 데이터는 미래에 모델 능력을 형성하며, 평가는 모델 능력을 후속적으로 노출합니다. 그러나 샘플, 프롬프트, 디코딩, 및 점수 규칙을 하나의 노이즈 점수로 압축합니다. 실제 최적화는 이 반대 방향으로 작동합니다. 엔지니어는 실패를 먼저 관찰하고, 데이터를 수정해야 합니다. 그러나 두 가지 측면은 상호 불일치하는 어휘를 사용합니다. 벤치마크 이름과 샘플당 정확도와 데이터 출처, 도메인, 및 품질 레이블을 사용합니다. 이 추론은 일반적으로 직관이 아닌 메소드입니다. 우리는 이 단절을 닫기 위해 <em>능력 슬라이스</em>를 사용합니다. 샘플이 공통된 배경 조건, 작업 유형, 해결 연산, 및 출력 제약 조건을 공유하는 평가 샘플의 집합입니다. 이 단일 약점을 지역화할 수 있을 정도로 정밀하지만, aggregation이 가능하며, 벤치마크 이름이 너무粗하고, 단일 샘플이 너무 노이즈가 많은 경우에도 안정적입니다. 이 단위로 구성된 평가 분류, 비-인스트럭션 데이터 분류, 및 매핑 규칙은 벤치마크 수준의 실패를 대상화 가능한, 테스트 가능한 데이터 조정을 위한 닫힌 루프를 형성합니다.

에이전트 6월 30일

자기이행 자기진화 에이전트를 위한 홀드아웃 선택

대규모 언어 모델(LLM) agent들은 무게 업데이트를 거치지 않고 자연어 아티팩트를 통해 개선되고 있다. 자연어 아티팩트는 반사, 워크플로우, 플레이북, 치트 시트, 또는 최적화된 프롬프트와 같은 것들이며, 동결된 정책을 조건화한다. 이러한 방법들은 일반적으로 단일 벤치마크에서만 도움이 된다는 점을 보고한다. 우리는 이러한 방법들을 하나하나 비교하고 더 명확한 그림을 드러내려고 한다. R

AI 모델 6월 29일

몸을 가진 계획에서 ẩn상태 사회 규범 준수에 대한 기준점: NormAct

대규모 멀티모달 언어 모델(LLM)은 점점 더 embodie된 계획자로 egocentric 환경에서 사용되고 있다. 이러한 환경에서 성공적인 작업은 수행한 명령에 달려 있으면서도 사회적으로 적절한 방식으로 행동하는 것이 중요하다. 명확한 목표는 특정 행동을 최적화하는 데 도움이 될 수 있지만, 암묵적인 사회적 규범은 숨겨진 제약을 가질 수 있다. 기존의 평가 방법은 주로 명확한 목표 달성을

에이전트 6월 26일

OpenFinGym: 개체 추정 기법을 평가하기 위한 검증 가능한 다중 작업 기마 환경

금융 업무 워크플로우에 대규모 언어 모델 agent를 점점 더 많이 적용하고 있지만, 그 평가가 여전히 개별 업무에 걸쳐서 분산되어 있고, 벤치마크 업무의 금융적 관련성은 종종 무시되고 있다. 그러나 금융 업무는 본질적으로 다단계의 것이며, 예측, 전략 구축, 위험 관리, 거래와 같은 상호 의존적인 업무를 포함한다. 기존 플랫폼은 일반적으로 단일 업무에 집중하고 있기 때문에 agent의 co

LLM PC 6월 26일

다중 모드 LLM 평가에서 놓치고 있는 것

대규모 다중 모드 언어 모델(Multimodal Large Language Model, MLLM)은 다양한 입력을 처리하고 텍스트 응답을 생성할 수 있다. 예를 들어, 텍스트, 이미지, 음성, 비디오 등이다. 이러한 모델의 기능은 급격히 발전하고 있지만 평가에는 그에 맞는 속도는 유지되지 않고 있다. 대부분의 기존 평가 기준은 단일 작업에만 제한되어 있으며, 모델이 모드 간 정보를 통합하는지

AI 모델 6월 26일

LLM에 의한 알고리즘 거래 프로그램의 메타 진화

최근 연구 결과 대규모 언어 모델(LLM)은 프로그래밍 및 증명 발견을 위한 의미 변형 연산자로 작용할 수 있음을 보여주었습니다. 대부분의 현재 응용 프로그램은 정적 코딩 벤치마크에 집중하고 있습니다. 우리는 알고리즘 거래라는 새로운 도메인에 이 패러다임을 확장합니다. 이 도메인은 소음이 많은, 비stationary, 그리고 극단적으로 불연속적입니다. 우리는 AlgoEvolve라는 LLM-기

AI 모델 6월 25일

인간 체스에서의 Elo-해제된 플레이어 스타일 임베딩을 위한 등급 조건된 잔차 이동 모델

인간의 체스 스타일을 학습하는 연구를 진행했다. 각 선수별로 learned embedding을 사용하여 move history를 통해 스타일의 유사성을 측정하며, Elo 점수와는 분리된 embedding을 학습했다. key design는 rating-conditioned base move model을 사용하여 Elo 점수에 따라 선수가 typical하게 움직이는 패턴을 학습하고, learne

에이전트 6월 25일

네트워크 관계 추론기를 자동으로 평가하는 방향으로의 프로젝트: Auto-월드

관계 구조에 대한 논리적 추론은 신경 모델에 큰 도전을 남기고 있으며, 특히 훈련된 모델이 적용해야 하는 지식이 문제 인스턴스가 더 어려운 것보다 harder 한 경우에 그러하다. 이 문제를 해결하기 위해 우리는 대규모 언어 모델(LLM)을 사용하여 벤치마크 생성을 자동화하고, 배포 및 문제 인스턴스를 생성하는 방식으로 어려운 인스턴스를 생성하는 것을 목표로 end-to-end 학습을 수행한

에이전트 6월 24일

실제 언어의 다국어 다이얼로그 이미지 부정 확인을 위한 멀티모달 부정 정보 탐지

바이럴 게시물은 이제는 장문의 다언어 문장, 여러 이미지, 혼합된 출처, 그리고 텍스트와 이미지의 서술 오류를 포함하는 것이 더 많아지면서, 다중 모드 정보 오류 탐지의 중요성이 점점 더 커지고 있습니다. 현재의 기준점과 방법들은 여전히 이 환경에 잘 맞지 않고 있습니다: 일반적으로 짧은 캡션, 단일 이미지, 이진 레이블, 또는 하나의 조작 소스를 분리하는 경향이 있습니다. 또한, 현실적인

연구 6월 24일

신경symbolic 주행: 규칙 기반 신뢰할만한 주행을 위한 VLAs의 합리적 추론

VLA 모델을 Chain-of-Thought (CoT) 사고 방식으로 구현한 드라이빙 모델은 미리 학습된 VLM 표현을 활용하고 자연어로 중간 결정을 노출할 수 있기 때문에 매력적입니다. 그러나 현재의 합리화는 계획된 동작과 논리적으로 연결된 중간 결정을 유지하기 위해 필요한 단계별 결정 의미론이 부족합니다. 우리는 Neuro-Symbolic Drive, 심볼릭 AI 시스템인 규칙 기반 계획

인기 태그