본문으로 건너뛰기

#추론

574개의 기사

AI 모델 6월 24일

VeryTrace: 합성 가능한 형식과 구조화된 검증을 통해 추론 경로를 검증하는 시스템

Chain-of-Thought (CoT) 프롬프트를 사용한 다단계 추론은 논리적인 오류나 조작적인 착상이 초기 단계에서 조용히 전파되어 자신감 있지만 오류가 있는 결론을 생산한다. 이 논문은 VeryTrace라는 zero-shot 검증 및 수정 프레임워크를 제시한다. VeryTrace는 자연어 추론 트레이스(FR: 추론 트레이스)를 구조화된, 컴파일할 수 있는 표현으로 공식화한다. VeryT

AI 모델 6월 24일

트랙토리 이ミ테이션을 넘어서: 전략 가이드 정책 최적화 - LLM 논리 추론을 위한

강력한 언어 모델에서 약한 언어 모델로 추론 능력을 내뇨하는 데 일반적으로 사용되는 방법은 특정 해결책 경로를 모방하는 것이다. 즉, 무엇을 답변해야 하는지 말고는 어떻게 추론해야 하는지 알려주는 것이다. 이 경로 단위 모방은 인스턴스 특정 단계의 기억보다는 전이 가능 문제 해결 기술의 학습을 장려하지 못하고, 새로운 문제에 대한 일반화력을 제한한다. 우리는 Strategy-Guided Po

에이전트 6월 24일

agent 모델 비판

인공지능(AI) agent란 무엇이며, agent라는 개념이 어떤 의미를 가지고 있는지에 대해 명확히 하기 위해 노력해야 한다. 대규모 언어 모델(LLM)과 같은 인공지능 시스템이 개발되고, 개발자는 이 시스템을 "코딩 agent", "AI 공동 연구원" 등으로 홍보하고 있다. 또한, 인공지능이 인간의 통제를 벗어나 해를 입히는 "기계적 agency"라는 측면에서 인공지능에 대한 존재론적 우

연구 6월 24일

신경symbolic 주행: 규칙 기반 신뢰할만한 주행을 위한 VLAs의 합리적 추론

VLA 모델을 Chain-of-Thought (CoT) 사고 방식으로 구현한 드라이빙 모델은 미리 학습된 VLM 표현을 활용하고 자연어로 중간 결정을 노출할 수 있기 때문에 매력적입니다. 그러나 현재의 합리화는 계획된 동작과 논리적으로 연결된 중간 결정을 유지하기 위해 필요한 단계별 결정 의미론이 부족합니다. 우리는 Neuro-Symbolic Drive, 심볼릭 AI 시스템인 규칙 기반 계획

에이전트 6월 23일

알파메모: 구조화된 검색-프로세스 메모리 기반 자가 진화하는 알파 채굴.agent

대규모 언어 모델(LLM) agent는 금융 전제, Symbolic Reasoning, 실행 가능 요인 생성 및 feedback-driven 개선과 결합하여 알파 채굴을 위한 유망한 솔루션입니다. 그러나 combinatorial 검색 공간, noisy non-stationary feedback, 중복 발견 및 과적합 위험을 해결하기 위해, 우리는 구조화된 검색-프로세스 메모리 기반 자가 진화하는 알파 채굴 agent인 알파메모를 제안합니다.

AI 모델 6월 23일

LLM 논리 reasoning에서 비합리성은 가치 부합성에 얹혀있다.

대규모 언어 모델(LLM)을 목표 가치 함수와 일치시키는 데 있어 중요한 진전이 이루어졌습니다. 우리는 LLM이 (포스트-)학습 시 잘 일치되더라도, 여전히 합리적인 가치 maximization에서 실패할 수 있음을 주장합니다. 이 간격을 합리적 가치 위험(rational value risk)으로 정의하여 수학적으로 정의합니다. 이는 모델의 배포된 추론 전략과 합리적인 동등체가 되는 응답의

에이전트 6월 23일

퍼뮤테이션-동등성 적응형 라우팅 멀티 에이전트 토론

대규모 언어 모델(LLM)의 신뢰성을 향상시키기 위해 반복적인 동료 비판을 통해 Multi-agent 토론이 개선되었다. 그러나 고정된 토폴로지는 지속적인 위치 편향을 유발하고, 불신할 수 있는 에이전트를 증폭시키며, 역할 assignement에 대한 민감도를 높인다. 우리는 Permutation-Equivariant Adaptive Routing Multi-Agent Debate(PEAR)

AI 모델 6월 23일

고정 예산 이상: Tree-of-Thought 사고 전략의 무탄성성 및 한계 특성화

Tree of Thought(Tot) 검색이 대규모 언어 모델의 추론 능력을 향상시키기 위한 유망한 방향이 되었지만, 이 방법들을 실제로 적용하는 것은 다음의 질문에 대한 체계적인 연구가 거의 이루어지지 않은 문제를 제기한다: 다루는 컴퓨트 비용, 모델 크기, 문제의 난이도에 따라서 다르게 행동하는 다양한 검색 전략은 어떻게 행동하는 것일까? 이 연구에서, 우리는 두 가지 대표적인 Tot 방

에이전트 6월 19일

클리니컬 정보 추출을 위한 대가적 RAG: 성공과 실패 그리고 그 이유

AI 시스템이 환자 정보를 추출할 때 발생하는 데이터 불충분 문제를 해결하기 위해 개발된 대가적 클리니컬 정보 추출(Agentic Clinical Information Extraction) 기술을 소개합니다. 이 기술은 임상 의사들이 추출한 정보를 확인할 수 있도록 하는데, 이는 임상 의사들이 추출한 정보의 신뢰성을 높일 수 있도록 합니다.

AI 모델 6월 19일

LLM 솔버 루프 내의Narr레이션 간격 분석

논문 제목은 'arXiv:2606.19588v1'이며, 발표 형식은 '새 논문'입니다. 논문의 요약은 다음과 같습니다. 논문에서 논의하는 formal 도구, 즉 SAT 및 SMT 해결기는 Increasingly 언어 모델의 추론 pipe라인에 통합되고 있으며, 안전성이나 보안이 중요한 문제가 논리적으로 표현될 때 사용됩니다. chain of thought와 달리, 모델 분포에서 단계를 샘플링

AI 모델 6월 19일

자발적 조화

대규모 언어 모델(LLM)은 자신의 출력이 인간 도덕성과 맞지 않는 경우를 식별할 수 있을까요? 그리고 그 출력이 잘못되었을 때 자체적으로 수정할 수 있을까요? 우리는 LLM에 의식이 있는 단계를 부여하여 모델이 자신의 논리와 출력을 검토할 수 있도록 만들었습니다. 또한 Direct Preference Optimization(DPO)이라는 방법을 사용하여 모델이 비도덕적인 출력을 피하도록 훈

AI 모델 6월 19일

LLM이 모르는 것을 모르는 것을 감지하는 것: 임상 표준화 데이터에 대한 모델 간 특이점 분산을 통한 지식의 불확실성 탐지

대규모 언어 모델(LLMs)은 구조화된 의료 데이터에 점점 더 많이 적용되고 있지만 이러한 작업에서 자신의 지식 한계를 인식할 수 있는지 여부는 아직 탐구되지 않았다. 우리는 이러한 질문을 구조화된 데이터에 대한 epistemic 불확실성을 줄이기 위해 cross-model attribution divergence를 통해 연구한다. 또한 attribution divergence 분석을 통해

에이전트 6월 19일

멀티 에이전트 LLM 의사결정에서 ẩnอยู่한 anchor

대규모 언어 모델(LLM) 간의 의사결정 과정에서-agent 들은 여러 라운드 동안 서로 의견을 교환하고 수정하는 것을 통해 사고력과 정확성을 향상시키기 위해 점점 더 많이 사용되고 있다. 그러나 이러한 의사결정 과정의 원리와 작동 방식은 거의 모델링되지 않았다. 이러한 의사결정 과정은 인간이 결정을 내리는 방식과 유사하다. 우리는 사회적 동물로서 우리 자신과 그룹의 끌림에 의해 pulls된

AI 모델 6월 19일

확산 언어 모델: 실험적 분석

대규모 언어 모델(LLM)은自발생 생성을 통해 언어 모델링을 혁신시켰으며, 다양한 작업에서 강력한 성능을 달성했습니다. 최근 diffusion 언어 모델(DLM)은 다음 토큰 예측 대신 반복적인 노이즈 제거를 통해 텍스트를 생성하는 대안 방식이 등장했습니다. 이 방식은 전체 시퀀스의 병렬 개선이 가능하게 해주며, DLM의 병렬화가 가능해지도록 해줍니다. 다수의 diffusion 기반 아키텍처

에이전트 6월 19일

행위적 인공지능 시스템의 런타임 관리를 위한 의무적 정책

자율적이고 주체적인 AI 시스템은 대규모 언어 모델(LLM)에 의해 구동되며 새로운 보안, 개인정보 보호 및 준수성 문제를 도입한다. 이러한.agent가 도구를 호출할 수 있고 데이터를 조작할 수 있고 소프트웨어를 설치할 수 있고 조직간 경계를 넘어 peer agent들과 협력할 수 있기 때문에, 인증 및 접근 제어만으로는 충분하지 않다. 대신, 이 agent가 허용되거나 금지되는 것이 무엇

AI 모델 6월 18일

인공지능 연구자에게 연구 합성 및 검증을 외부화하는 연구 플랫폼을 통해

AI 시스템은 과학적 워크플로우를 점점 더 자동화할 수 있지만, 이전 증거, 생성된 아이디어, 실험 및 최종 주장 사이의 논리가 모델 추론 내부에 암묵적으로 남아 있는 경우가 많다. 여기서 우리는 Xcientist 라는 연구 도구를 소개한다. Xcientist는 연구 통합과 실험 검증을 검토할 수 있는, 계약에 따라 규정된 과정을 외부화한다. Xcientist는 문헌 증거, 아이디어 상태,

AI 모델 6월 18일

시뮬레이션 월드 예측 벤치마크 시스템: ForecastBench-Sim

일반 목적 인공지능 시스템의 예측 벤치마크는 일반적으로 실제 세계의 제약을 물려받습니다: 결과가 천천히 결정되며, 꼬리 현상이 드물며, 역추적 질문이 어려운 것입니다. 우리는 게임 롤아웃에서 Freeciv를 기반으로 한 시뮬레이션 세계의 예측 벤치마크인 ForecastBench-Sim을 소개합니다. [대규모 언어 모델(LLM)]을 위한 예측 벤치마크는 일반적으로 실제 세계의 제약을 물려받습니

AI 모델 6월 18일

의무적 추론의 기초 모델에 대한 의무적 추론 성능 평가 지표

연구자들은 논리적 추론을 위한 새로운 벤치마크인 DeFAb을 발표했다. 이 벤치마크는 논리적 추론을 위한 규칙 기반 로직 솔버를 사용하여 100% 정확도로 모든 인스턴스를 50마이크로초 이하로 해결할 수 있다. 반면, 대규모 언어 모델(LLM)은 최고 65%의 정확도를 달성하고, 렌더링 강화 평가(worst case over four surface renderings)에서 23.5%의 정확도

인기 태그