본문으로 건너뛰기

검색

전체 기사

에이전트 6월 11일

트리서커: 트리 구조화된 실패와 되돌아가는 깊은 검색

트리서커는 깊은 검색에서 제어된 실패와 되돌아가는 framework를 제안합니다. 트리서커는 트리 구조화된 상태에서 branch-and-return search를 사용하여 탐색을 조직합니다. 트리서커는 textual UCB signals를 사용하여 promising branch, uncertain alternative, 또는 unproductive continuation을 선택합니다. 트리서커는 실패와 되돌아가는 loop를 지원하기 위해 evidence, uncertainty, conflicts, progress, 및 failure cues를 attached branch에 저장합니다.

연구 6월 11일

촉각 지식 reasoning을 개방된 세계에 적용하기 위한 대규모 데이터 및 행동 인식 표현을 사용한 TOUCH THINKER

손감각은 상호작용하는 agent가 물리적 세계를 이해하는 데 중요한 모달리티입니다. 최근 연구에서는 손가락 신호를 언어 시스템에 통합하여 촉각 지식 reasoning을 수행했지만, 실용적인 개방 세계 환경으로 이러한 시스템을 확장하는 것은 두 가지 주요 지연 요인으로 인해 어려움을 겪고 있습니다. (1) 현재 촉각 지식 reasoning 데이터셋은 형식과 규모에서 제한적이기 때문에 촉각 관찰

에이전트 6월 11일

슬라이딩 윈도우 주의형 강화 학습이 수학적 추론에서 주의형 주의를 경쟁력 있는 것으로 만듭니다.

논문 제목: arXiv:2606.11634v1 논문 요약: 합리적이고 의사결정적인 대규모 언어 모델(LLM)의 속도는 빠르게 향상되었지만, 이에 따라 긴 문맥에 대한 추론의 필요성이 증가했습니다. 그러나 SELF-ATTENTION(SA)이 문맥 길이에 비례하여 성능이 향상되므로, 이에 대한 해결책을 찾기 위해 SWARR(Sliding-Window Attention with Reinforced

에이전트 6월 11일

HERO: 환경 관찰을 통한 주체적 자기 분리(self-distillation) 위한 후향적 개선된 반영(Reflection)

강화 학습은 일반적으로 경로의 종료 결과를 통해 멀티 턴 에이전트 기능을 향상시킵니다. 이로 인해 각 중간 턴에 대한 크레딧 assignments를 결정하는 것이 어렵습니다. 최근 정책 기반의 자가 distillation 방법은 유리한 feedback를 token-level supervision으로 변환하여 자가 교사와 같은 promising 대안을 제공합니다. 그러나 이 패러다임을 멀티 턴

에이전트 6월 11일

Agent 능력 조직이 런타임 동작을 어떻게 변경하는지 측정하는 방법

arXiv:2606.11543v1 발표 유형: 새로운 요약: Agent Skills은 추론 시 절차 지식에 대한 대규모 언어 모델(LLM) agent를 증강하지만, 현재 벤치마크는 Skill이 말하는 내용과 구성이 어떻게 다른지 거의 구별하지 못합니다. 우리는 Progresssive Disclosure를 통해 이 구별을 연구합니다. Progresssive Disclosure는 짧은 루트 파일

에이전트 6월 11일

금융 및 수치 연산 reasoning을 위한 Market-of-Claims Code Agent: MoCA-Agent

금융 및 표 형식 질문에 대한 답변은 유창한 논리만으로는 충분하지 않다. 답변은 정확한 사실, 공식, 단위, 부호 및 척도를 기반으로 하여야 한다. 단일 잘못된 행 또는 잘못된 연산이 조용히 합리적인 하지만 오류인 결과를 생성할 수 있다. 우리는 \textsc{MOCA-Agent}라는 시장의 요구 사항에 따라 코드 에이전트를 소개한다. 이 시스템은 자유 형식의 다중 에이전트 토론을 claim