본문으로 건너뛰기

#추론

574개의 기사

에이전트 5월 18일

내부 비판을 학습하는 강화 학습: ICRL

대규모 언어 모델(LLM) 기반 에이전트는 실수를 하지만, 비판은 종종 동일한 모델을 올바른 행동으로 안내할 수 있습니다. 그러나 비판이 제거되면 모델은 동일한 쿼리에서 다시 실패할 수 있습니다. 이는 모델이 비판의 지침을 내부적 능력에 내재화하지 못했기 때문입니다. ICRL은 이러한 문제를 해결하기 위해, 비판을 학습하는 강화 학습 프레임워크를 제안합니다. 이 프레임워크는 비판과 해결책을 공유하는 백본에서 동시에 훈련하는 것을 목표로 합니다.

에이전트 5월 18일

스킬스미스: 경계 지침을 기반으로 한 런타임 인터페이스로 컴파일하는 에이전트 스킬

대규모 언어 모델(LLM)-기반 에이전트 시스템에서 스킬은 다양한 영역에서 널리 채택되고 있습니다. 기존 프레임워크에서는 스킬이 런타임 태스크와 매치되면 컨텍스트 지침으로 에이전트의 추론 루프에 주입되며, 특수한 태스크 해결 능력을 제공합니다. 그러나 이 실행 패러다임은 무의미한 컨텍스트 주입과 재귀적 스킬 별 추론 및 계획을 포함한 두 가지 주요 오버헤드를 유발합니다. 이를 해결하기 위해 우리는 경계-첫 번째 컴파일러-런타임 프레임워크인 스킬스미스를 제안합니다. 스킬 패키지를 오프라인으로 최소화된 실행 인터페이스로 컴파일하여, 스킬에서 미세한 운영 경계를 추출하여 에이전트가 런타임에서만 관련된 구성 요소에 동적으로 액세스하고 실행할 수 있도록 합니다. 이를 통해 무의미한 컨텍스트 주입과 재귀적 추론 오버헤드를 최소화할 수 있습니다.

에이전트 5월 15일

시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각?

시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각? 시각-언어 모델(Vision-Language Models, VLMs)에서 강력한 시각-논리 동기화를 달성하는 것이 고급 VLM의 중심 목표입니다. 최근 연구는 이 목표를 달성하기 위해 아키텍처 디자인이나 주체적 워크플로우를 사용했습니다. 그러나 이러한 접근 방식은 종종 정적 텍스트 논리나 외부 주체적 복잡성의重大 계산 및 엔지니어링 부담으로 복잡해집니다. 더 나쁜 것은, 이러한 큰 투자가 비례하는 성과를 제공하지 않으며, 종종

AI 모델 5월 15일

법적 해석과 형식 논리: 신뢰성, 가정, 그리고 AI 법률 사고의 미래

대규모 언어 모델의 법적 적용은 큰 약속과 심각한 위험을 동시에 가져옵니다. 법조인들은 계약을 논리적으로 Reasoning, 문서를 작성하고 출처를 분석할 수 있는 AI가 제공하는 이점을 누릴 수 있지만, 법적 업무의 고위험성은 현재 AI 시스템이 제공하는 정도의 엄격함을 요구합니다. 법적 AI가 신뢰할 수 있는 결과를 제공하기 위해 고안된 새로운 접근법이 소개됩니다.

LLM PC 5월 15일

다음 토큰 예측과 속성 추정: 자가회귀 시퀀스 모델의 새로운 접근

자연어 처리 모델은 일반적으로 다음 토큰 예측 목표로 훈련되지만, 많은 다운스트림 애플리케이션은 시퀀스 수준의 속성을 추정하거나 제어할 수 있는 능력을 필요로 합니다. 다음 토큰 예측은 훈련 중에 지역 패턴에 대한 과적합, 전역 구조에 대한 과소적합, 그리고 인플루언스 시간에 전역 속성을 예측하거나 안내하기 위한 다운스트림 수정 또는 비싼 샘플링이 필요합니다. 이에, 우리는 속성에 대한 조건부 속성 변환기(Conditional Attribute Transformers)를 소개합니다. 이 프레임워크는 단일 전방 패스에서 세 가지 중요한 기능을 제공합니다: (1) 시퀀스 전체에서 각 토큰에 대한 신용 부여, (2) 대체 다음 토큰 선택에 대한 속성 차이량의 계산, (3) 다음 토큰과 속성 확률의 조합에 기반한 시퀀스 디코딩.

에이전트 5월 15일

정치 뉴스 Nugget: 대규모 언어 모델(LLM) 기반 장소성 정보 통합 평가

정치 뉴스 Nugget은 대규모 언어 모델(LLM)을 장소성 프레임워크에 통합하여 정적 질문에 대한 긴 문맥 정보 검색을 개방형 탐색으로 변형시켰다. 그러나 실제 세계 사용에는 모델이 분산된 소스에서 '장거리' 사실을 발견하고 통합하는 능력이 필요하며, 이 능력은 평가되지 않았다. 정치 뉴스 Nugget은 400명의 글로벌 엘리트를 위한 정치 전기서를 구성하여 10,000개 이상의 정치 사실을 포함하는 다언어 벤치마크를 소개한다.

에이전트 5월 15일

2차원 프레임워크: AI 에이전트 디자인 패턴의 인지 기능과 실행 토폴로지

AI 에이전트 아키텍처에 대한 기존 프레임워크는 단일 관점에서 시스템을 설명합니다. 산업 가이드는 실행 토폴로지에 초점을 맞추며, 인지 과학 교과서는 인지 기능에 초점을 맞추며, 그 중 하나만으로도 아키텍처적으로 DISTINCT 시스템을 구분할 수 없습니다. 우리는 인지 기능축과 실행 토폴로지축을 결합하여 두 차원 분류를 제안합니다. 인지 기능축에는 7개 카테고리(컨텍스트 엔지니어링, 메모리, 사유, 액션, 반영, 협력, 지배)가 포함되며, 실행 토폴로지축에는 6개의 구조적 아키텍처가 포함됩니다. 이 결과로 27개의 이름이 지정된 패턴이 생성되며, 13개는 원래 이름이 지정됩니다.

에이전트 5월 15일

그래프비트: 비선형 에이전트 오케스트레이션을 위한 그래프 기반 에이전트 프레임워크

그래프비트는 대규모 언어 모델(LLM) 프레임워크에서 잘못된 라우팅, 무한 루프, 비재현성 실행을 방지하기 위해 개발된 그래프 기반 에이전트 프레임워크입니다. 이 프레임워크는 워크플로우를 명시적으로 정의하고, 에이전트가 타입 함수로 작동하며, 엔진이 라우팅, 상태 전환, 도구 호출을 관리하여 재현성과 감사성을 보장합니다.

에이전트 5월 14일

계층적 행위 언어 평의회

계층적 행위 언어 평의회(arXiv:2605.12718v1)가 발표한 뉴스에 따르면, 현재 대규모 언어 모델(LLM)의 논리적 사고를 향상시키기 위한 다중 에이전트 토론의 방법론은 다음과 같은 제한점을 가지고 있다. 토론은 믿음 경로에 대한 마르팅게일(martingale)을 유발하고, 다수 투표는 대부분의 관찰된 이익을 고려하고, LLM은 라운드별로 신뢰도 상승보다는 조정(calibration)을 나타낸다. 토론의 genuin value와 대화 시스템의 전체 가치가 지대-truth 태스크에서 아니

연구 5월 14일

작업 기반 지식 업데이트 문제: 첫 번째 계층 의존성과 결정 가능성

작업 기반 지식 업데이트 문제, 즉 작업 효과를 반영하는 지식 기반을 업데이트하는 과제는 일반적으로 두 번째 계층 논리를 필요로 합니다. 첫 번째 계층 특수 사례를 식별하기 위해 지식 기반 또는 작업 효과를 제한하는 것은 행동에 대한 논리적شر의 중심 주제 중 하나입니다. 그러나 이러한 작업 클래스, 즉 지역 효과, 정상, 및 사이클이 없는 작업이 첫 번째 계층 논리를 허용하는 것으로 알려져 있지만, 이러한 업데이트의 크기를 분석하는 시스템적인 연구는 실용적용을위한 필수적이지만 누락된 주제입니다. 이 논문에서는 상황 계산기 프레임워크를 사용하여 이러한 작업 클래스에 대한 첫 번째 계층 업데이트가 합리적인 가정하에 일반적으로 다항식으로 증가한다는 것을 보여줍니다. 또한 지식 기반이 결정 가능한 부분집합인 두 변수 첫 번째 계층 논리 또는 상수와 함께 일반화된 이론과 같은 경우, 업데이트도 동일한 부분집합에 속한다는 것을 보여줍니다. 이는 결정 가능성과 실용적용을 보장합니다.

LLM PC 5월 14일

인간과 맞닿은 의사결정에 적합한 암묵적 사용자 선호도 학습

대규모 언어 모델(LLM)은 많은 응용 분야에서 사고 모듈로 사용되며, 효율적이지만 인간과 맞닿은 의사결정에 적합하지 않습니다. 인간과 맞닿은 의사결정은 명시적으로 명시된 목표와 암묵적 사용자 선호도가 함께 고려되어야 합니다. 그러나 암묵적 사용자 선호도를 고려하는 기존 접근법은 사용자와의 반복적인 상호작용이 필요하거나, 과제와 환경에 대한 암묵적 선호도를 일반화하지 못하여 실용적 활용성에 제한을 받습니다.

LLM PC 5월 13일

다중 모드 모델에 맞는 선택을 할 수 있을까? LatentRouter

대규모 다중 모드 언어 모델(LLM)의.espresso heterogeneous한 강점이 OCR, 차트 이해, 공간적 사고, 시각적 질문에 대한 답변, 비용, 지연 시간과 같은 다양한 태스크에 걸쳐 있습니다. 이에 따라 효과적인 다중 모드 모델 라우팅은 단순히 쿼리 난이도를 추정하는 것 이상의 작업을 필요로 합니다. 라우터는 현재 이미지-질문 입력의 다중 모드 요구 사항을 각 후보 모델의 능력과 매칭해야 합니다. LatentRouter는 대규모 다중 모드 언어 모델(LLM)의 라우팅을 카운터페이탈 다중 모드 유틸리티 예측으로 형식화하는 라우터를 제안합니다.

AI 모델 5월 13일

과학에서 언어 모델의 창의성을 개방하는 비유적 사고

과학에서 언어 모델의 창의성을 개방하는 비유적 사고 자율 과학은 특히 생의학 분야와 같은 복잡한 분야에서 과학적 발견을 증대시키는 것을 약속한다. 그러나 이것은 AI 시스템이 열린 문제에 대해 일관되게 새로운 및 다양한 솔루션을 생성할 수 있어야 한다. 우리는 열린 문제 해결의 경우 언어 모델(LM)을 평가하고 그들의 모드 충돌 모드에 대한 다양성으로 생성되는 다양성의 경향을 측정한다. 모드 충돌을 완화하기 위해 우리는 솔루션 생성의 새로운 접근 방식으로 비유적 사고(AR)를 도입한다. AR는

AI 모델 5월 13일

OPD의 많은 얼굴: 장애물, 기계, 그리고 해결책

온-폴리시 디스틸레이션(OPD)과 온-폴리시 셀프 디스틸레이션(OPSD)은 대규모 언어 모델(LLM)에서 promise하는 포스트-트레이닝 방법으로, 모델이 자신의 정책에서 샘플링한 경로에서 밀집한 토큰 수준의 감독을 제공합니다. 그러나 기존의 결과는 혼합된 상태로 남아 있습니다: OP(S)D는 시스템 프롬프트와 지식 내부화에 promise를 보여주었지만, 최근 연구에서는 불안정성과 악화가 보고되었습니다. 이 연구에서는 OPD와 OPSD가 언제 작동하고, 언제 실패하며, 왜 실패하는지에 대한 종합적인 실험적 연구를 제시합니다.

AI 모델 5월 13일

OLIVIA: 배포 시점의 결정 과정에 대한 행동 적응을 위한 온라인 학습

대규모 언어 모델(LLM) 에이전트는 논리적 추론, 행동 선택, 관찰을 번갈아가며 시퀀셜 결정 과제를 해결합니다. 배포 설정에서 에이전트가 반복적으로 관련된 다단계 과제를 처리할 때, 작은 행동 선택 오류가 시간 낭비, 지연, 신뢰도 감소로 누적될 수 있습니다. existing inference-time adaptation methods for LLM agents mainly rely on prompting or retrieval, which influence behavior indirectly through context manipulation.

에이전트 5월 13일

코에볼루션 챔버: TEST-TIME 멀티 에이전트 시스템의 개인, 팀, 인구 규모에서의 동시 진화

멀티 에이전트 테스트 시간 진화는 단일 에이전트 진화의 N번 반복이 아니다. 단일 에이전트 학습자는 자신의 컨텍스트와 메모리만 진화할 수 있다. 멀티 에이전트 시스템은 누가 협력하고, 어떻게 협력하고, 인구에 걸쳐 지식이 흐르는지까지 진화한다. 이러한 구성 요소는 단일 에이전트에 해당하는 것이 없고, 협력의 가치가 있는 수평적 지식 전달을 제거하는 테스트 시간 메서드의 한계를 극복한다. 이 연구에서는 테스트 시간 진화의 세 가지 수준을 보유한 TRAINING-FREE 프레임워크인 EVOCHAMBER를 제시한다. 이는 CODREAM(Collaborative Dreaming)이라는 POST-TASK 프로토콜을 통해 팀이 실패하거나 의견이 달라질 때, 에이전트들이 협력하여 반영하고, 통찰력을 경쟁적으로 강한 에이전트에게 전달한다. 이는 협력의 가치를 보존하는 동시에 지식의 미흡한 부분을 채운다.

AI 모델 5월 12일

鏡中的공격자: 안정된 이중 역할 자극을 통해 안전성을 깨는 방법

AI 안전성을 향상시키기 위한 자극된 팀(self-play) 접근법에서, 동일한 모델의 다양한 인스턴스가 공격자와 방어자 역할을 하며, 0-1 게임에서 공격자가 방어자를 탈옥시키려고 시도하는 경우, 자극된 팀이 Nash 평형에 수렴할 경우, 모델은 게임 설정 내에서 안전하게 반응할 수 있다. 그러나 동일한 모델을 사용하여 두 역할을 강제하는 파라미터 공유는 안정성과 성능을 향상시키지만, 이론적 및 아키텍처적 한계를 초래한다.

인기 태그