본문으로 건너뛰기

#추론

577개의 기사

에이전트 5월 8일

로직의 대화: BALAR, 인간과 대화하는 대규모 언어 모델(LLM)의 능동적 사고

대규모 언어 모델(LLM)은 사용자와의 다중 라운드 정보 교환을 필요로 하는 인터랙티브 설정에서 점점 더 많이 작동하고 있습니다. 그러나 대부분의 현재 시스템은 대화에 반응적으로 다루고, 정보가 누락된 것을(reasoning about what information is missing) 및 다음에 질문을 선택하는(principled mechanism to reason about which question should be asked next) 데 대한 원리적인 메커니즘을 가지고 있지 않습니다. BALAR(Bayesian Agentic Loop for Active Reasoning)이라는 새로운 알고리즘을 제안합니다. 이 알고리즘은 task-agnostic outer-loop 알고리즘으로, fine-tuning이 필요하지 않고 대규모 언어 모델(LLM) 에이전트와 사용자 간의 구조화된 다중 라운드 상호 작용을 허용합니다. BALAR은 latent states에 대한 구조화된 믿음을 유지하고, expected mutual information을 최대화하여 clarifying 질문을 선택하고, 현재 상태 표현이 부족할 때 동적으로 상태 표현을 확장합니다. BALAR은 detective cases, thinking puzzles, clinical diagnosis과 같은 다양한 벤치마크에서 모든 baseline을 능동적으로 물리치고, AR-Bench-DC에서 14.6%의 정확도 향상, AR-Bench-SP에서 38.5%의 정확도 향상, iCraft-MD에서 30.5%의 정확도 향상이 있습니다.

AI 모델 5월 8일

annot레이터 안전 정책 이해를 위한 해석 가능성

AI 출력의 안전성과 위험성을 정의하는 安전 정책은 데이터 레이블링과 모델 개발을 지침으로 삼지만, 레이블링에 대한 의견 차이는 광범위하여 나타나며, 운영 실패 (레이블러가 업무를 이해하거나 수행하지 못함), 정책의 불명확성 (정책의 단서가 해석의 여지를 남김), 또는 가치의 다양성 (다른 레이블러가 안전성을 다른 시각으로 보는 경우)과 같은 여러 원인으로부터 발생할 수 있다. 이러한 원인을 구별하는 것은 중요하다. 예를 들어, 운영 실패는 품질 관리를 요구하고, 불명확성은 정책의 명확화를 요구하

에이전트 5월 7일

SensingAgents: 강력한 IMU 활동 인식을 위한 멀티 에이전트 협력 프레임워크

인체 활동 인식(Human Activity Recognition, HAR)은 모바일 헬스, 스마트 환경, 인간-컴퓨터 상호작용에 중요한 역할을 하는 발진측정장치(IMU) 센서를 사용하여 인식하는 것이다. 그러나 현재의 심층학습 기반 HAR 모델은 레이블이 된 데이터에 의존하는 것이 너무 많고, 위치에 따라 모호성이 발생하고, 투명한推論이 부족한 문제를 가지고 있다. 고급 에이전트 프레임워크에 영감을 받아, 대규모 언어 모델(LLM)을 사용하여 협력하는 에이전트를 시뮬레이션 하는 대규모 언어 모델

AI 모델 5월 7일

어떻게 생각 모드는 LLM 도덕적 판단을 변경합니까? 5 개의 국경 모델을 통제 한 인스턴트 대 사고 비교

생각 모드가 대규모 언어 모델(LLM)의 도덕적 판단을 어떻게 변화시킬까? 100개 도덕적 판단 시나리오와 5대 전위된 사고 훈련된 LLM(클로드 소ネット 4.6, GPT 5.5, 지미니 3 플래시, 딥시크 V3.1, 퀸 3.5 397B)에서 제공자 노출 사고 모드를 활성화하는 것이 도덕적 판단에 어떤 영향을 미치는지 평가했다. 적은 차이로 총 100개 도덕적 판단 시나리오에서 binary-verdict(이진 판단) 합의율은 instant와 thinking 모드 모두 통계적으로 차이가 나지 않

연구 5월 7일

Transformers의 Implicit Deductive Reasoning의 스케일링 속성

Transformer에서 깊이 제한된 호른 절언의 암묵적 의사결정 추론의 스케일링 특성에 대한 연구 (arXiv:2605.04330v1) 암묵적 의사결정 추론의 스케일링 특성을 깊이 제한된 Transformer에서 조사했습니다. 암묵적 추론의 증명 가능성과 불필요한 특성을 분리하고 알고리즘적 일치성을 강제함으로써, 충분히 깊은 모델에서 역방향 접두사 마스크를 사용할 때, 암묵적 추론은 그래프 구조와 문제 크기에 따라 명시적 CoT 성능에 접근할 수 있음을 발견했습니다. 그러나 CoT는 깊이 추

AI 모델 5월 7일

Speculative Generation를 위한 Parallel Prefix Verification

파라렐 프리픽스 verificaion을 통한 예측적 생성을 위한 PARSE(Parallel pRefix Speculative Engine) 프레임워크를 제안한다. existing speculative decoding 방법은 token-level equivalence로 인해 target model이 각 토큰을 확인해야 하기 때문에 짧은 acceptance 길이와 신속한 속도 향상에 한계가 있다. semantic 또는 segment-level verification으로 acceptance granul

LLM PC 5월 7일

Pro$^2$Assist: Long-Horizon Procedural Tasks를 위한 멀티모델 자존심적 인 인식과 함께 지속적인 단계적 인 예방적 지원

인공 지능이 지원하는 개인 보조기(Pro$^2$Assist) : 지속적인 단계 인식에 기반한 대비적 보조기와 멀티모달 에โก 센트릭 인식으로 인한 장기 절차적인 작업의 지원 장기 절차적인 작업은 일상 생활에서 흔히 볼 수 있는 작업들이다. 최근 대규모 언어 모델(LLM)의 발전으로 인해 일상 활동을 지원하는 개인 보조기들이 등장했다. 하지만 기존의 시스템들은 주로 사용자의 질의에 의해 트리거되는 반응적인 지침 제공 또는 격리된 단기 사건에 대한 제한적인 대비적 보조기 제공에 그치고 장기 절차적인

AI 모델 5월 7일

신경-기호형 QA에서 제한 요소는 시간적 추론이 아님: 확률적 불일치 프레임워크

시간 논리 추론이 지연 요인이 아니다: 신호-기호 QA 프레임워크의 확률적 불일치 프레임워크 arXiv:2605.04243v1 발표 유형: 새로운 요약: 큰 언어 모델(LLM)은 복잡한 시간 논리 추론 과제에서 고유한 성능을 계속해서 나타내고 있지만, 이 실패 모드는 자체적 결함 있는 자가 회귀적 논리적 추론에 널리 ATTRIBUTED로 인해 발생한다. 이 논문에서, 우리는 이 널리 퍼진 이야기와는 달리, 시간 논리 추론이 기본적인 지연 요인이 아님을 입증하고, 오류와 추론 실패를 분리하는 확률적

AI 모델 5월 7일

Time-Expanded Interaction Graphs를 통해 수술 팀 역학의 실시간 모델링

수술 팀의 동적 관계를 실시간으로 모델링하는 새로운 접근법을 제안했습니다. 본 접근법은 시간 확장된 상호 작용 그래프(time-expanded interaction graphs)를 사용하여 팀의 동적 관계를 모델링합니다. 이 그래프에서는 팀원들을 시간 인덱스화된 노드(time-indexed nodes)로 모델링하고, 의사소통을 정의하는 지시 그래프(directed edges)를 사용합니다. 이 방법은 동적 상호 작용 모델링을 허용하며, 정적 그래프 신경망(static graph neural net

연구 5월 7일

Andre: 주의 기반 신경-기호적 다이퍼런트 가능한 규칙 추출기에 대한 리뷰 보기

ANDRE: 주의집중 기반 심볼-신경망 다분해 규칙 추출기 대규모 언어 모델(LLM)에서 주의집중 기반 심볼-신경망 다분해 규칙 추출기(ANDRE)가 제안되었다. ANDRE는 데이터에서 해석 가능한 첫 번째 순서 규칙을 학습하는 목표를 가진 지능형 논리 프로그래밍(ILP)의 새로운 프레임워크이다. ANDRE는 기존의 심볼과 신경망 기반 접근법이 노이즈와 확률적 설정에서 확장하기 어렵다는 것을 해결하기 위해 설계되었다. ANDRE는 지능형 논리 프로그래밍에서 기존의 규칙 템플릿과 논리 연산자를

AI 모델 5월 7일

큰 언어 모델의 여행 계획 능력 검토

여행 계획 기능을 향상시키기 위한 대규모 언어 모델(LLM)의 재검토 arXiv:2605.03308v1 발표 유형: 새로운 요약: 여행 계획은 장기적인 추론에 중요한 업무로 LLM의 심각한 한계를 노출한다. 그러나 기존의 벤치마크와 평가 방법은 종단에서 계획을 평가하는 방식으로, 해석의 불완전성과 실패의 근본 원인 분석이 어려운 문제를 보유하고 있다. 이 간극을 좁히기 위해, 여행 계획을 5개로 구성된 원자적 하위 기능으로 분리한다. 그 중에는 Constraint Extraction, Tool U

에이전트 5월 7일

에이전트 안전 판단 향상 : 조절 된 벤치마크 재 작성 및 배포 외의 속임수 시나리오에 대한 아날로그 이유

인공지능 요소의 안전한 판단을 높이기 위한 연구: 제어된 벤치마크 재작성 및 유사성 논리 reasoning을 통한 분포 이탈 시의 속임수 시나리오 arXiv:2605.03242v1 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)로 güç을 받는 도구 사용 인공지능 시스템은 웹, 앱, 운영 체제 및 거래 환경에서 점점 더 많이 배포되고 있습니다. 그러나 현재의 안전 벤치마크는 명시적 위험에 중점을 두고 있으므로 모델이 속임수 또는 모호한 경로를 판단할 수 있는 능력을 과대평가할 수 있습니다.

AI 모델 5월 7일

LLM에서 결정적 계산을위한 권장 및 실행 기반 방법의 평가

대규모 언어 모델(LLMs)은 자연어 이해와 추론能力을 갖추고 있지만, 정밀하고 결정론적인 계산을 수행할 수 있는지는 불명확하다. 이 연구에서는 Chain-of-Thought(CoT), Least-to-Most 분해, Program-of-Thought(PoT), Self-Consistency(SC)와 같은 다수의 프롬프트 전략을 체계적으로 평가했다. 이 평가에는 정밀하고 오류가 없는 출력이 필요한 작업들이 포함되어 있으며, 이 작업에는 이진 카운팅, 가장 긴 부분 문자열 탐지, 산술 평가가 포함된

LLM PC 5월 7일

ADAPTS : 자동 프로토콜 - 증상 추적을 위한 에이전트 분해

감정 인식에서 부정적인 감정을 표현하는 임상적 추상 개념을 불특정 임상 상호 작용에서 모델링하는 것은 독특한 도전이다. 우리는 ADAPTS(대인적 분해를 위한 증상 추적에 대한 자동화된 프로토콜 무관 Framework, Agentic Decomposition for Automated Protocol-agnostic Tracking of Symptoms)라는 framework를 제시한다. 이 framework는 mixture-of-agents 대규모 언어 모델(LLM) 아키텍처를 사용하여 우울증과

에이전트 5월 7일

CreativityBench : Affordance-Based Tool Repurposing를 통해 에이전트 Creative Reasoning을 평가하기

인공지능의 창의력 연구: 도구 재활용을 통한 사물 기능 기반 도구 사용 평가 arXiv:2605.02910v2 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)의 최근 발전은 추론 및 환경 상호작용과 같은 작업에서 좋은 성능을 나타냈지만 창의적 문제 해결 능력은 여전히 연구되지 않은 상태이다. 우리는 창의적 도구 사용을 통해 이 능력을 연구한다. 여기서 모델은 지식 기반에 있는 사물의 기능 및 특성에 대하여 논리적으로 사고하며, 일반적인 사용을 의존하지 않고 사물의 새로운 용도를 사용한다

에이전트 5월 6일

다중 에이전트 자율적 사고를 위한 수력학

대규모 언어 모델(LLM)로 구동되는 과학 워크플로우에서 단일 에이전트 시스템(SAS)은 기본 패턴이지만, 단일 컨텍스트 창 내에서 도구 사용 및 합성과 같은 경로 계획에 단점이 있다. 단일 에이전트 아키텍처의 컨텍스트飽和현상을 해결하기 위해, 저자는 수력학 분야에서 다중 에이전트 시스템(MAS) 프로토タイプ를 제시한다. 이 프로토タイプ는 Layer Execution Graph(LEG)로 에이전트를 협조시킨다. 계획 에이전트는 자연어 경로 힐리스트릭스에 기반하여 도메인 지식을 캡처하는 query-specific execution topologies를 생성한다. 전문가 에이전트는 엄격한 도구 허용 목록 내에서 작동하고, 대체 데이터 클래스 역할을 한다. 계층 간에, 합성 에이전트는 병렬 출력을 짧은 요약으로融合하고, 보고 에이전트는 최종 응답을 합성한다. 에이전트 실행 시, 런타임 로그는 모든 도구 호출에 대한 증명성을 지원한다.

AI 모델 5월 6일

구조된 지식에 기반한 LLM 기반 결함 분석 및 방지 지침 제공 시스템

이 연구에서는 LPBF를 대표하는 안전한 사례 연구로 LPBF 결함 분석 및 방지 지침을 제공하는 구조화된 지식에 기반한 LLM 기반 결함 분석 및 방지 지침 제공 시스템을 제안합니다. 이 시스템은 27 가지 LPBF 결함 유형을 포함하여 계층적 카테고리와 원인 관계로 조직된 지식베이스에 기반을 두고 있습니다. 이 시스템은 일반적인 목적의 시각-언어 모델과 비교하여 상당한 일치도를 나타내는 문법적 자연어 질의에 대한 지식의 체계적인 검색, 문헌에 근거한 결함의 설명, 인코딩된 프로세스 지식으로부터 결함의 원인과 방지 전략에 대한 지침을 제공합니다.

AI 모델 5월 6일

AI 워크플로 아키텍처의 효과 투명한 조직: 의미 보존, 표현적 최소성, 결정 가능성 경계

연구자들은 AI 워크플로 아키텍처의 효과 투명한 조직을 위한 새로운 방법을 제안했다. 이 방법은 내부 컴퓨팅 표현성을 줄이지 않고도 효과 수준의 조직을 강제할 수 있다. 연구자들은 이 방법을 Rocq 8.19을 사용하여 Interaction Trees를 정의하고, 모든 효과적 지시를 조정하는 구버넌스 오퍼레이터 G를 정의했다.

LLM PC 5월 4일

인간-기계 협생에서 인공지능의 역할

인공지능이 인간과 기계의 경계를 점점 모호하게 만들면서, 인간-기계 협생에서 발생하는 인공지능이 생성한 정보의 정의가 어려워지고 있습니다. 이러한 정보는 인간과 기계가 상호 작용하여 생성되기 때문에, 인공지능이 참여했는지를 의심하는 것이 아니라, 어떻게 참여했는지를 살펴보아야 합니다. 이 연구에서는 인공지능이 자연어 생성에서 수행하는 기능 역할을 추적하는 문제를 다루고, 입력 프롬프트에서 작성을 추론하고, 생성 과정에 이 역할을 삽입하여, 결과 텍스트에서 AI 참여의 본질을 회복하는 방법을 제안합니다.

AI 모델 5월 4일

텍스트와 이미지에 대한 생각: 장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로

장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로 장기 시야 로봇 조작을 위해서는 논리적으로 일관되고 기하학적으로 기반을 둔 계획이 필요하다. 기존의 시각-언어-행동 정책은 계획을 잠재 상태에 숨기거나 하나의 모달리티만 노출한다. 텍스트만으로 구성된-chain-of-thought는 원인-결과 관계를 제시하지만 공간적 제약을 무시한다. 반면, 시각 예측은 기하학적 지시를 제공하지만 자주 지역적이고 의미적으로 제약적이다. 우리는 Interleaved Vision--Language Reas

LLM PC 5월 4일

토큰 아레나: 지속적인 벤치마크가 AI 추론에서 에너지와 인지성을 통합하는 것

토큰 아레나는 AI 시스템을 모델과 제공자 수준에서 비교하는 공공 추론 벤치마크와 달리, 실제로 배포 결정을 내리는 단위는 엔드포인트입니다. 엔드포인트는 특정 양자화, 디코딩 전략, 지역, 그리고 서빙 스택이 노출되는 (제공자, 모델, 재고 관리 단위) 튜플입니다. 이 연구에서는 5개의 핵심 축(출력 속도, 첫 번째 토큰까지의 시간, 작업 부하 혼합 가격, 실제 컨텍스트, 그리고 라이브 엔드포인트에서 품질)에서 추론을 측정하고, 이들을 합쳐 모델링된 에너지 추정과 함께 3개의 주요 합성물로 통합하는 지속적인 벤치마크인 토큰 아레나를 소개합니다. 이들 합성물은 1) 1주에 해당하는 에너지, 2) 1달에 해당하는 비용, 3) 엔드포인트의 신뢰도(출력 분포가 첫 번째 파티의 참조와 얼마나 유사한지)를 나타냅니다. 이 연구의 새로운 점은 경험적이고 방법론적인 측면입니다. 78개의 엔드포인트가 12개의 모델 가족을 제공하는 동안, 동일한 모델이 다른 엔드포인트에서 평균 정확도가 수학 및 코드에 대해 최대 12.5점, 첫 번째 파티의 인식률과 최대 12점, 꼬리 지연 시간이 10배, 그리고 모델링된 1주에 해당하는 에너지가 6.2배 차이가 나게 됩니다. 추가적으로, 작업 부하에 대한 혼합 가격이 리더보드의 순위를 크게 바꿔줍니다. 3:1의 입력:출력 비율이 있는 채팅 프리셋에서 10위 안에 있는 7개의 엔드포인트는 20:1의 리트리벌-증가 프리셋에서 10위 밖으로 떨어지며, 1:5의 사유 프리셋은 채팅 프리셋에서 비용으로 페널티를 받는 프론티어 클로즈 모델을 상승시킵니다.

에이전트 5월 4일

이동 계획 최적화 애플리케이션을 위한 에이전트 AI

이동 계획 최적화에 있어 과거의 시스템들에게는 경로를 선택하는 것에만 초점을 맞춘 시스템들이 많았습니다. 하지만 실제 이동 계획의 질은 여행 시간, 에너지 소비, 교통 상황 등 다양한 요인에 의해 영향을 받습니다. 따라서 이 논문에서는 에이전트 AI 프레임워크를 통해 동적 개선이 가능하도록 교통, 충전, Interest Point를 위한 특화된 에이전트를 조정하는 오케스트레이션 에이전트를 설계하고, Trip-planning Optimization Problems Dataset을 통해 정의된 최적의 솔루션과 카테고리 수준의 태스크 구조를 제공하여 최적화 성능의 객관적인 평가를 가능하게 합니다.

인기 태그