본문으로 건너뛰기

#추론

574개의 기사

AI 모델 6월 18일

NAVI-Orbital: 자율 천문 관측을 위한 초보 반영구적 시각-언어 모델의 첫 우주 데모

지구 관측 데이터의 생성 속도와 지상에서 사람이 참여하는 처리 속도는 지구 관측 데이터를 다운받는 대역폭과 지구 관측 데이터를 분석하는 속도 사이의 격차를 만들고 있다. 이 논문은 NAVI-Orbital이라는 소프트웨어 시스템을 Low Earth Orbit(Low Earth Orbit, LEO) 위성에 배치한 것이다. 2026년 4월 16일, NAVI-Orbital은 대규모 언어 모델(LLM

AI 모델 6월 17일

LLM 논리적 추론에서 구조적 불확실성을 통해 일관성을 측정하는 방법

대규모 언어 모델(LLM)은 불안정한, 모순된, 또는 일관되게_rank_할 수 없는 경로를 통해 동일한 결과를 도출할 수 있다. 이는 특히 단계별 추론 reasoning에서 특히 문제가 된다. 기존의 방법은 신뢰성을 주로 출력 분산(output dispersion)으로 평가하기 때문에 샘플된 답변의 차이를 측정한다. 그러나 이 방법은 모델이 경쟁하는 추론 후보를 일관되게_rank_할 수 있는

연구 6월 16일

CONCORD: 기기-클라우드 RAG에서 문서 격리 하에 비동기식 희소 집계

Retrieval-augmented generation(RAG)은 추론 시 외부 지식 통합을 통해 언어 모델을 향상시키는 데 중요한 기술로 등장했습니다. 장치-클라우드 협력 추론으로 인해 작은 언어 모델을 에지 장치에 배포하는 것은 가능해졌습니다. 따라서 장치 내의 개인 문서와 클라우드 내의 공공 지식이 분리된 새로운 설정이 발생했습니다. 개인 정보 보호와 정책 제약으로 인해 raw 문서 교

LLM PC 6월 16일

가정 가능한 자율 데이터 과학을 위한 증명 가능한 데이터 과학: 툴-기반 논리 reasoning을 통해 불규칙 TSQA 해결

실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대

AI 모델 6월 16일

Riemann 가설 근접 증명: 경계 증명서, 검증 가능한 유한 라가리아 불등식 및 명시적 실패 지역화

Riemann 가설은 수학의 중추적 미해결 문제 중 하나입니다. 이 기사에서는 AI-assisted 증명 시스템을 사용하여 Riemann 가설에 대한 부분 증명을 생성하고, 명시적으로 남아있는 수학적 장벽을 식별하는 것을 목표로 합니다. 본 연구에서는 Verifiable Growing Physical Transformer with Recursive Self-Improvement(VGPT-RSI)를 사용하여 Riemann 가설 근접 증명서를 생성하고, 유한 라가리아 불등식에 대한 증명서를 생성하는 두 가지 RH-접근 증명 작업을 수행합니다.

에이전트 6월 16일

LLM agent에 대한 표준화된 Prolog 도구 인터페이스: PrologMCP

프론티어(_frontier) 논리 reasoning-tuned 언어 모델은 깊은 deductive 작업에서 실패하고, 내부 reasoning을 확장하여 성능을 개선하는 비용은 좋지 않다. Symbolic delegation은 논리 프로그래밍의 자동 formalization pipe line을 통해 문제를 번역하고, 해결기를 통해 추론을 수행하는 보완적인 경로를 제공한다. 그러나 현재 논리 프

AI 모델 6월 15일

포커 아레나: 전략적 사고와 LLM의 기억능력 다중 축 프로파일링

불확실성을 감안한 전략적 사고는 협상, 금융, 정책 등에서 중요한 결과를 내는 결정에 기반을 두고 있지만 현재 게임 벤치마크는 다양한 사고 차원들을 단일 스칼라로 축소시키고 있다. 이로 인해 최첨단 대규모 언어 모델(LLM)의 기능 구조가 조사되지 않았다. 우리는 포커 아레나(Poker Arena)라는 무제한 텍사스 홀덤 토너먼트 플랫폼을 소개한다. 이 플랫폼은 세 가지 메모리 아키텍처(한

AI 모델 6월 15일

LLM을 이용한 수학적 분석의 정리 증명에 대한 두 단계 평가 시스템: MA-ProofBench

대규모 언어 모델(LLMs)은 자동 증명 논리를 크게 진전시키면서도 현재까지 존재하는 공식 평가 지표는 수학적 범위와 난이도에서 모두 제한적이다. 대부분은 대수학과 초등 수학적 수학 이론과 같은 더 쉽게 공식화되는 분야에 집중되어 있으며, 더 깊은 사고를 요구하는 하위 분야인 수학적 분석에 대한 범위는 제한적이다. 이러한 공백을 해결하기 위해 우리는 Mathematical Analysis를

에이전트 6월 12일

과학적 난제를 다양한 규모에 대처하는 인공지능 agent의 성능 평가

과학적 발견을 가속하기 위해 개발 중인 인공지능(AI) agent의 실질적인 능력은 실제 연구 환경에서 아직도 잘 이해되지 않았다. 현재까지 AI agent를 평가하기 위한 표준 벤치마크는 과학적 작업을 수행하는 데 필요한 복잡성, 다양성, 연장된 논리 reasoning을 거의 반영하지 못하고 있다. 반면 과학적 과제에 대한 벤치마크는 연구를 정적이고 직접적인 문제로 축소시키며, 상호 작용

에이전트 6월 12일

마인딩 메커니즘의 수학적 명세: 이론적 마음의 이해

인간의 마음을 이해하기 위한 이론적 모델인 이론적 마음의 이해(ToM-U)가 개발되었습니다. 이 모델은 다른 사람의 믿음을 추론하는 문제를 컴퓨터 수준에서 해결하고, 그들의 믿음 상태를 추정하는 방법을 명시적으로 정의합니다. ToM-U는 이론적 마음의 이해를 위한 새로운 접근 방식으로, 인간의 마음을 이해하는 데 중요한 역할을 할 것으로 기대됩니다.

에이전트 6월 12일

인간 스타일의 검색-보강 VLA agent를 이용한 폐쇄형 주행 시뮬레이션

closed-loop 주행 시뮬레이터는 일반적으로 규칙 기반의 교통 관리자나 단일 행동 모드에 학습된 모델로 생성된 비 이고 트래픽 에이전트를 환경에 채우고 있습니다. 최근 연구는 관찰 데이터에 대한 후속 라벨이나 대규모 언어 모델(LLM)로 추정한 보상 가중치를 통해 스타일 변이를 소개했습니다. 그러나 이러한 신호는 스타일이 보상해야 하는 프록시로 작용하는 반면, 사람에게 스타일에 따라 주

AI 모델 6월 12일

피타고라스 증명기: 증명 효율성을 개선하기 위한 증명기 증명 형식 확장

최신 레인(Lean) 정리 증명 도구는 대량의 학습 및 추론 계산을 통해 성능을 달성하지만, 부족한 검증된 증명 데이터와 형식적 증명 탐색의 긴 추론 경로로 인해 양상교정 학습(Supervised Fine-tuning, SFT)과 샘플링이 비싸다. 우리는 Pythagoras-Prover라는 계산 효율적인 오픈 소스 레인 정리 증명 도구 가족을 제시한다. 이 가족은 두 가지 생성 패러다임을 포

에이전트 6월 11일

트리서커: 트리 구조화된 실패와 되돌아가는 깊은 검색

트리서커는 깊은 검색에서 제어된 실패와 되돌아가는 framework를 제안합니다. 트리서커는 트리 구조화된 상태에서 branch-and-return search를 사용하여 탐색을 조직합니다. 트리서커는 textual UCB signals를 사용하여 promising branch, uncertain alternative, 또는 unproductive continuation을 선택합니다. 트리서커는 실패와 되돌아가는 loop를 지원하기 위해 evidence, uncertainty, conflicts, progress, 및 failure cues를 attached branch에 저장합니다.

연구 6월 11일

촉각 지식 reasoning을 개방된 세계에 적용하기 위한 대규모 데이터 및 행동 인식 표현을 사용한 TOUCH THINKER

손감각은 상호작용하는 agent가 물리적 세계를 이해하는 데 중요한 모달리티입니다. 최근 연구에서는 손가락 신호를 언어 시스템에 통합하여 촉각 지식 reasoning을 수행했지만, 실용적인 개방 세계 환경으로 이러한 시스템을 확장하는 것은 두 가지 주요 지연 요인으로 인해 어려움을 겪고 있습니다. (1) 현재 촉각 지식 reasoning 데이터셋은 형식과 규모에서 제한적이기 때문에 촉각 관찰

에이전트 6월 11일

슬라이딩 윈도우 주의형 강화 학습이 수학적 추론에서 주의형 주의를 경쟁력 있는 것으로 만듭니다.

논문 제목: arXiv:2606.11634v1 논문 요약: 합리적이고 의사결정적인 대규모 언어 모델(LLM)의 속도는 빠르게 향상되었지만, 이에 따라 긴 문맥에 대한 추론의 필요성이 증가했습니다. 그러나 SELF-ATTENTION(SA)이 문맥 길이에 비례하여 성능이 향상되므로, 이에 대한 해결책을 찾기 위해 SWARR(Sliding-Window Attention with Reinforced

인기 태그