AURA: 동작 게이트 메모리, VRAM에서 일정한 정책
AURA-Mem은 VRAM에서 데이터 센터와 달리 Embodied Agent가 실행되는 한계를 고려하여 개발된 새로운 메모리 기술입니다. AURA-Mem은 이전 관찰에서 다음 행동이 변경되지 않는 경우에만 메모리에 쓰기를 수행하는 learned gate를 사용하여 메모리 쓰기를 최소화합니다.
333개의 기사
AURA-Mem은 VRAM에서 데이터 센터와 달리 Embodied Agent가 실행되는 한계를 고려하여 개발된 새로운 메모리 기술입니다. AURA-Mem은 이전 관찰에서 다음 행동이 변경되지 않는 경우에만 메모리에 쓰기를 수행하는 learned gate를 사용하여 메모리 쓰기를 최소화합니다.
논문 제목: 2606.00103v1 해석: 다단계 상호 작용 프레임워크를 제시하며, 이 프레임워크는 추론을 능동적인 증거 취득과 믿음 갱신으로 다루는 것을 목적으로 한다. 대규모 언어 모델(LLMs)은 작업 규칙만을 받으며, 숨겨진 환경에 타겟된 질문을 내보내고, 시간에 따른 부분 관찰을 통합하며, 최종 답을 제출할 때까지 결정해야 한다. 표준 성공률과 상호 작용 효율성 외에도, 제어된 문맥
제조 공정의 안정성을 위해 제품-aware 딥 어투언코더를 개발하여 제품의 특성에 맞는 이상 탐지 시스템을 구축했습니다. 이 시스템은 제품의 특성에 맞는 이상 탐지 성능을 보였으며, 제품의 특성에 맞는 이상 탐지 성능을 보인 제품-aware 시스템은 제품의 특성에 맞는 이상 탐지 성능을 보였습니다.
어떤 행동의 품질은 미래의 사건에 의존하거나 게임 규칙을 위반하는 움직임에 의존하거나 다른 플레이어의 결정에 의존할 수 있으므로, 다중 agent 전략적 상호 작용을 위한 언어 모델 agent를 교육하는 것은 핵심적인 어려움을 제시한다. 표준 강화 학습은 각 단계마다 보상을 할당할 수 있다고 가정하지만, 이 가정은 시간과 agent 간의 결과가 얽혀 있는 설정에서 실패한다. 우리는 지연된 단
지식 그래프(KG) 추론에서 논리 규칙은 해석 가능성과 관계 패턴을 모델링할 수 있는 능력으로 지식 그래프의 기본적인 구성 요소입니다. 그러나 기존 규칙 탐색 방법은 단순한 chain-like 규칙에만 집중하고 그래프와 같은 구조의 richer 관계 정보를 무시합니다. 특히, 그래프와 같은 규칙은 탐색 공간의 combinatorial 폭발로 인해 계산적인 성능이 저하됩니다. 이 한계는 또한
대인간 논리 시스템의 신뢰성을 높이는 데 있어, 도구 호출 환경 간 일반화가 큰 과제로 남아 있다. 개별 벤치마크에서 강력한 결과를 달성하는 대규모 언어 모델(LLM)도, 논리 전략의 조합, 중간 상태의 보존, 도메인 간 도구의 조정 등에 대한 능력은 여전히 미흡하다. 우리는 MAVEN(Modular Agentic Verification and Execution Network)이라고 하는 가
건강 관리 기관의 전략적 제공자 반응은 건강 관리 기관 자체와 분리되지 않는다: 기존의 건강 관리 AI 벤치마크는 이러한 반응을 고정하고 있기 때문에 기관이 생성하는 균형에 따라 기관을 평가할 수 없다. 우리는 병원 기관 설계를 대규모 언어 모델(LLM) 기반 프로그램 합성으로 재구성한다: 형식화된, 검사 가능한 규칙 프로그램은 Medi-Sim이라는 다중-agent 시뮬레이터의 다섯 가지 전
의료 결정-making( Clinical Decision-making, CDM)은 실제-world 의료 워크플로우에서 중요한 역할을 하며, 의사들은 불완전한 증거를 기반으로 진단을 추론하고 치료를 선택하거나 미래의 건강 결과를 예측한다. 대규모 언어 모델(LLM)은 강력한 언어 능력, 광범위한 생의학 지식, 효율성으로 인해 이러한 결정에 지원하기 위해 점점 더 많이 사용되고 있지만, LLM이
물리학 문제를 텍스트에서 다이어그램으로 생성하는 것은 물리 법칙을 엄격히 지키는 것을 요구한다. 현재 생성 모델은 시각적으로 가능성이 높은 출력을 생성하지만, 힘 벡터를 무작위로 생성하고, 보존 법칙을 무시하고, 기하학적 제약을 위반한다. 우리는 물리 법칙을 지키는 신경符号 pipeline인 PhyDrawGen을 제안한다. 먼저 대규모 언어 모델이 문제 텍스트에서 유형화된 장면 그래프를 추출
호기심은 대규모 언어 모델 시스템의 신뢰도에 대한 주요 장애물로, 특히 다중 agent pipe라인에서 지원되지 않는 주장들이 무제한으로 단계별로 전파될 수 있다. 이 연구에서는 Nested Learning 아키텍처를 대규모 언어 모델 시스템에 적용하여 호기심을 줄이는 새로운 방법을 제안한다.
비 텍스트 형태의 유전 특성 설명을 개체-품질(Entity-Quality, EQ) 어휘로 연결하는 것, 즉 유전 특성 어휘화는 비교 형태학적 데이터의 연구 간 통합을 위한 필수 과제입니다. 이 번역 작업은 매우 훈련된 전문가에 의해 수행되었기 때문에 대규모로 확장하기 어려우며 이는 주요 걸림돌입니다. Dahdul 등(2018)은 일곱 가지 계통학적 연구에 걸쳐 Entity-Quality 어휘
인지 범주형 트랜스포머(Cognitive Categorical Transformer, CCT)는 대규모 언어 모델(LLM)인 GPT-2 Small의 백본에 범주론적 수학적 전제를 기반으로 한 지식 요소를 추가하여 언어 모델링 성능을 향상시킨다. CCT는 WikiText-103 데이터셋에서 21.27의 검증 퍼플렉스성(perplexity)를 달성하였으며, 동일한 조건하에 훈련된 GPT-2 Small의 baseline보다 2.92 PPL 감소가 기록되었다.
arXiv:2605.27567v1 Announce Type: new Abstract: Causal discovery is a cornerstone of scientific reasoning, yet whether large language models can perform it reliably remains an open question. Recent be
arXiv:2605.27566v1 Announce Type: new Abstract: Progress in neural combinatorial optimization for Dynamic Flexible Job Shop Scheduling Problem (DFJSP) is currently hindered by a methodological tension
오프라인 계층적 강화 학습에서 지속 가능한 스킬을 얻는 것은 여전히 열린 문제입니다. 연구팀은 지역 동적regularity를 활용하여 지역 전이와 전역 컨텍스트 간의 유사한 행동 시퀀스를 학습하여 지속 가능한 스킬을 재사용하는 데 도움을 주는 알고리즘 CARL(Contrastive Action-based Representations for Reusable Local Control)을 제안했습니다. CARL은 복잡한 인공인간 환경에서 의미 있는 스킬의 군집화를 보였고, OGBench 벤치마크에서 HIQL과 통합되었을 때 다운스트림 성능을 향상시켰습니다.
arXiv:2605.26396v1 Announce Type: new Abstract: Large multimodal models (LMMs) have rapidly advanced in perception and reasoning; however, it remains unclear whether these capabilities generalize to d
마인드 리딩(Theory of Mind, ToM)이라는 것은 다른 사람의 지식, 의도, 감정 등을 추측하는 능력을 의미하는데, 이 능력을 대규모 언어 모델(LLM)에서 평가하는 데에는 종점 질문에 대한 답변을 통해 평가한다. 이 방식은 모델이 실제로 강력한 논리를 위해 필요한 내재된 정신 상태 표현을 구성하고 있는지 여부를 가려주고, 다른 사람의 의견이 달라지는, 변화하는, 또는 잘못된 의견
AI agent가 중요한, 장기적인 기업 업무 작업을 완료하기 시작했지만, 기업용 작업을 위한 훈련 및 평가 환경은 현실성, 검증 가능성, 규모를 균형있게 유지하는 데 어려움을 겪고 있다. 환경 및 작업 생성이 자주 artifact drift라는 실패 모드에 걸린다. 즉, 약하게 연결된 프로세스에서 지시문, 환경, 오라클, 검증기는 자주 작업이 필요한 것을について 동의하지 못하고, 불해결 가
인공지능(AI) agent가 장기적으로 운영되면서 운영 시스템으로 사용되면서, 여전히 초기화된 모델처럼 평가되고 있다. 첫 번째 운영일(day-one) 기준점은 시스템의 기본적인 질문을 놓치고 있다. 그 질문은 agent가 배포된 후 얼마 동안 신뢰할 수 있는 상태를 유지하는지다. 모델의 가중치가 고정되어 있어도, agent의 실제 상태는 계속해서 변하고 있다. 이는 agent가 상호 작용
현재 도메인 지식 artifact에서 수학적 프로그래밍 모델(model)로의 제약 학습(Constraint Acquisition, CA) 및 관련 연구는 충분한 기준점의 부족으로 제한되고 있습니다. 이러한 결함은 재현성과 연구간 비교의 어려움으로 CA 방법의 성숙을 늦추고 있습니다. 기존의 기준점은 솔버 평가를 위한 것이었지만 CA 알고리즘을 평가하기 위한 것이었습니다. 또한 기준점은 구체적
arXiv:2605.23940v1 Announce Type: new Abstract: How do multi-turn reasoning systems fail? The expected answer is logical contradiction, in which the system's maintained state becomes unsatisfiable. We
arXiv:2605.23932v1 Announce Type: new Abstract: Despite strong medical benchmark accuracy, LLMs can exhibit severe multi-turn sycophancy in clinical dialogue, abandoning initial correct diagnosis unde
arXiv:2605.23931v1 Announce Type: new Abstract: The formal verification of operating system kernels requires precise specifications that capture the intended behavior of system calls. Writing these sp