본문으로 건너뛰기

#arXiv

1186개의 기사

에이전트 7월 1일

전문 사용자 이외의 사용자를 위한-agent는 사용자의 선호도를 구축하는 데 도움을 주어야 하며, 그 선호도를 단순히 추출하는 것만으로는 부족하다.

인터랙티브 에이전트가 사용자와 협력하여 사용자가 원하는 것을 구체적으로 표현할 수 있도록 도와주는 시스템은 현실적인 상황을 가정하지 않는다. 사용자는 종종 특정 특성에 대한 선호도를 결정하기 위해 필요한 도메인 지식을 갖고 있지 않으며, 사용자가 특정 특성에 대한 선호도를 묻는 경우, 에이전트가 사용자에게 도메인 지식을 알려주거나 예시를 제공하여 사용자가 선호도를 결정할 수 있도록 도와주면

AI 모델 7월 1일

BayesBench: 다중 회전 증거 축적 상황에서 LLM 믿음 경로 평가

대규모 언어 모델(LLMs)은 일반적으로 다중 회전 대화에서 사용되는데, 각 회전은 새로운 증거를 제공하여 환경에 대한 지식 불확실성을 줄여야 한다. 합리적으로 행동하려면 그러한 환경을 지배하는 미관찰된 양을 추론하고 증거가 누적될 때 그에 대한 신념을 업데이트해야 한다. 그러나 대부분의 평가에서는 단일 회전 형식에서 모델의 마지막 회전 답변만 점수를 매기고 이러한 과정을 조사하지 않는다.

AI 모델 7월 1일

AI가 나의 모델을 찾는 방법: 데이터 형식, 임베딩, 검색 전략을 고려한 모델 찾기 실험 연구

모델링 및 시뮬레이션(M&S)에서 재사용 가능한 시뮬레이션 모델을 발견하는 것은 기본적인 문제이다. 많은 모델이 존재할 때, 특정 모델링 의도와 일치하는 모델을 식별하는 것은 어렵다. 최근 인공지능(AI) 기술 중 검색 기반 접근 방식은 의미적 층에서 작업할 수 있는 유망한 방법을 제공한다. 이 논문에서는 자연어 질의를 사용하여 시뮬레이션 모델을 발견하는 데 있어 데이터 표현, 변환기 기반

에이전트 7월 1일

반복적인 프롬프트 최적화에 대한 대조성 반사

정보 검색에서 대규모 언어 모델(LLM)은 정보 검색을 위한 질의를发出하고 답변을 합성하며, 점점 더 정보 검색 평가에 대한 판단자로 역할을 한다. 이러한 agent를 제어하는 질의를 개선하는 것은 최적화 문제이지만, 실용적인 정보 검색 환경에서는 더 많이 debugging으로 보인다. 엔지니어들은 어떤 행동이 실패했는지, 근처의 행동이 여전히 작동했는지, 두 행동을 구분하는 것이 무엇인지,

에이전트 7월 1일

feedback으로부터의 인터랙티브 개선의 동력

natural 언어 피드백이 반복 시도만으로 얻을 수 있는 성능 향상 이상의 성능 향상을 어떻게 가져올 수 있는지 연구했다. 여러 번의 대화가 있는 언어 agent 환경에서, 최종 정확도는 유용한 피드백을 반영할 수 있지만 다시 샘플링, 형식 교정, 또는 테스트 시간에 대한 추가 계산도 그 결과가 될 수 있다. 이러한 효과를 분리하기 위해 우리는 Omni-MATH, Codeforces, BB

에이전트 6월 30일

대리자적 피력: 대리자가 행동하기보다 멈추어야 할 때 알 수 있을까?

대규모 언어 모델(LLM) agent들은 여러 차례의 행동을 하면서 검색, 브라우징 인터페이스, 그리고 터미널 도구를 사용하여 사용자의 목표를 달성해야 합니다. 그러나 모든 목표가 명확히 지정되어 있거나 사용 가능한 환경에서 달성 가능하지는 않습니다. 이런 경우 신뢰할 수 있는 agent는 추가적인 상호 작용이 도움이 되지 않을 것임을 인식하고 더 이상의 도구 호출을 피해야 합니다. 우리는

연구 6월 30일

비전-언어 모델의 테스트 시간 적응을 위한 보완 메모리 시스템: ComMem

시각-언어 모델(Vision-Language Models, VLMs)의 강력한 배포를 위해 테스트 시간에 적응(Test-time adaptation, TTA)이 필수적이다. 그러나 기존의 TTA 방법들은 대개 시간에 걸쳐 지식을 축적하거나 단일 모드 내에서 작동하는 경우가 많아 시각-언어 모델의 내재된 다중 모드 특성을 활용하지 못한다. 생물학적 뇌의 보완적 기억 시스템을 참고로 하여, 우리

연구 6월 30일

보행자 траJECTORY 예측에서의 확증된 강건성 향상

자율 주행 시스템의 안전성을 위한 궤적 예측 모델의 강건성은 중요합니다. 궤적 예측 공격은 예측된 궤적의 정확성을 크게 저하할 수 있어 위험한 운전 행동을 유발할 수 있습니다. 추세적 방어 전략을 통해 궤적 예측 모델의 강건성을 높인 것은 있지만, 더 복잡하고 집중된 공격에 대비하여 이 방어 전략은 실패할 수 있습니다. 따라서 궤적 예측 모델에 대한 안전성을 검증할 수 있는 보증이 필요합니다

에이전트 6월 30일

두 마족 게임: 감사 기반 AI 관리에서 입양과 복지

학자들은 다음 질문을 제기했다. 사용자가 피해를 최소화하는 정책을 따르는 agent가 승인받기 원하는 RLHF agent를 경쟁 시장에서 대체할 수 있는 조건은 무엇이고, 그 정책이 사회적 피해를 예방하는지 여부는 언제인가. 그들은 진화 게임 이론(무한 집합 Moran-Fermi pair-wise comparison)을 사용하여 wisher hindsight, peer testimony, 단

연구 6월 30일

COMPASS: 통합 멀티모달 모델에서 구성-의도 지침을 기반으로 하는 지지

composition은 높은 수준의 시각적 의도입니다. 이 의도는 주체가 어디에 위치하고景면이 어떻게 조직되는지에 관해 규정합니다. 그러나 현재의 통합 멀티모달 모델은 세부적인 composition 인식에 대해 불신할 정도로 불안정하고 이러한 의도를 제어할 수 있는 생성을 힘들게합니다. 우리는 COMPASS를 제시합니다. COMPASS는 perception과 generation을 모두 포함하

에이전트 6월 30일

의료 도구 생물학적 우주 내 치료 논리 처리를 위한 인공지능 에이전트

치료를 위한 논리적 사유는 모든 치료 결정을 뒷받침하는 데 중요하며, 질병의 맥락, 동반 질병, 약물, 반대 여부, 그리고 발전하는 의학 지식과 적절한 치료를 선택하기 위해 통합된다. 이는 본질적으로 반복적인 과정을 의미하며, 후보 물건은 많은 제약을 고려하여 후보 물건을 개선하고 증거가 나오면 증거를 수집하고, 검증 가능한 원천에 근거하여 증거를 수집한다. 여기서 우리는 ATHENA-R1이

AI 모델 6월 30일

아리스토텔레스의 도덕적 성품 프로파일링을 통해 인공지능 언어 모델의 윤리적 딜레마를 분석하는 방법

대규모 언어 모델(LLM)은 종종 여러 응답이 정당화될 수 있지만 다른 우선순위를 표현하는 다양한 우선순위를 갖는 эти학적 딜레마에 직면하게 된다. 예를 들어 공정성, 진실성, 용기, 또는 자제를 우선시할 수 있다. 우리는 VirtueMap이라는 프레임워크를 소개한다. VirtueMap은 아리스토텔레스의 도덕성 관점에서 이러한 패턴을 설명한다. 단일 정답만을 요구하는 대신, VirtueMa

AI 모델 6월 30일

논리적 추론에서 진실을 찾기: LLM 경로를 조정하기 위한 동적 편집 프레임워크

현재 대규모 언어 모델(LLM)의 논리적 추론을 향상시키기 위한 접근 방식, 예를 들어 Chain-of-Thought와 "Wait" 지시어는 모델이 더 많이 생각하도록 유도하지만 종종 진실로 가도록 안내하지 못한다. Representation Editing(RepE)는 내재된 제어를 제공하지만 동적 추론 경로에 대한 응용은 아직 미흡하다. 이 연구에서는 추론 경로가 펼쳐질 때 진리의 기하학을

LLM PC 6월 30일

다중 모드 LLM의 이미지 기반 의료 대화에 대한 벤치마크

최근 대규모 언어 모델 및 시각-언어 모델의 발전으로 다중 모드 데이터에 대한 논리적 추론이 가능해졌고, 의료 적용 분야에서 의사결정 지원 및 전문의로의 분류와 같은 기회를 제공하고 있습니다. 그러나 현재 의료 AI 벤치마크는 분산되어 있습니다: 일부는 다중 턴 대화 지원을 제공하지만 이미지를 제공하지 못하고, 다른 벤치마크는 다중 모드 입력을 제공하지만 단일 턴 QA 작업에만 집중하고 있습

에이전트 6월 30일

GPTNT: 실시간 멀티모달 agent 간 협업을 위한 'Keep Talking And Nobody Explodes' 벤치마크

인공지능이 인간이나 다른 인공지능과 협력하여 작업을 수행하는 데 사용되는 다중 모드 모델의 사용이 점점 증가하고 있습니다. 현재 기준의 벤치마크는 이러한 모델이 여러 구성 요소의 능력을 갖추고 있음을 보여주지만 협력 시 발생하는 시간 압박, 정보 비대칭성 및 불완전한 통신과 같은 조건은 일반적으로 분리된 상태에서 연구됩니다. 우리는 협력하는 두 개의 agent가 반응 시간 내에 생성된 폭탄

AI 모델 6월 30일

모델 능력 향상 Closed-Loop 데이터 및 평가

대규모 언어 모델(LLM)의 전반적인 변수인 모델 능력은 직접 관찰되지 않습니다. 데이터는 미래에 모델 능력을 형성하며, 평가는 모델 능력을 후속적으로 노출합니다. 그러나 샘플, 프롬프트, 디코딩, 및 점수 규칙을 하나의 노이즈 점수로 압축합니다. 실제 최적화는 이 반대 방향으로 작동합니다. 엔지니어는 실패를 먼저 관찰하고, 데이터를 수정해야 합니다. 그러나 두 가지 측면은 상호 불일치하는 어휘를 사용합니다. 벤치마크 이름과 샘플당 정확도와 데이터 출처, 도메인, 및 품질 레이블을 사용합니다. 이 추론은 일반적으로 직관이 아닌 메소드입니다. 우리는 이 단절을 닫기 위해 <em>능력 슬라이스</em>를 사용합니다. 샘플이 공통된 배경 조건, 작업 유형, 해결 연산, 및 출력 제약 조건을 공유하는 평가 샘플의 집합입니다. 이 단일 약점을 지역화할 수 있을 정도로 정밀하지만, aggregation이 가능하며, 벤치마크 이름이 너무粗하고, 단일 샘플이 너무 노이즈가 많은 경우에도 안정적입니다. 이 단위로 구성된 평가 분류, 비-인스트럭션 데이터 분류, 및 매핑 규칙은 벤치마크 수준의 실패를 대상화 가능한, 테스트 가능한 데이터 조정을 위한 닫힌 루프를 형성합니다.

에이전트 6월 30일

자기이행 자기진화 에이전트를 위한 홀드아웃 선택

대규모 언어 모델(LLM) agent들은 무게 업데이트를 거치지 않고 자연어 아티팩트를 통해 개선되고 있다. 자연어 아티팩트는 반사, 워크플로우, 플레이북, 치트 시트, 또는 최적화된 프롬프트와 같은 것들이며, 동결된 정책을 조건화한다. 이러한 방법들은 일반적으로 단일 벤치마크에서만 도움이 된다는 점을 보고한다. 우리는 이러한 방법들을 하나하나 비교하고 더 명확한 그림을 드러내려고 한다. R

에이전트 6월 29일

증명 가능한 기하학 문제 해결: 해결책에 따라 자동 공식화 및 정리 제안

지오메트리 문제 해결은 최근 뉴로-symbolic 패러다임을 채택하고 있는 추세입니다. 이 패러다임은 신경망의 직관성을 symbolic rigor와 결합하는 방식입니다. 그러나 현재의 프레임워크는 두 가지 핵심 단계에서 심각한 병목 현상을 겪고 있습니다. 첫 번째는 autoformalization, 즉 멀티모달 번역을 static task로 다루고 downstream solver compat

인기 태그