본문으로 건너뛰기

#arXiv

1187개의 기사

AI 모델 5월 7일

Regularized Centered Emphatic Temporal Difference Learning에 대한 리뷰 보기

오프-폴리시(Off-policy) 시간차분(TD) 학습에 함수 근사(Function Approximation)가 사용될 때 안정성, 투영 기하학_management(Projection Geometry), 분산 제어 controL(variance control)와 같은 구조적 트레이드오프가 발생한다. 강조된 시간차분(Emphatic TD, ETD)가 오프-폴리시 투영 기하학을 개선하는 데 도움이 되지만, 후속 추적(follow-on trace)이 높은 분산을 가질 수 있다. 우리는 벨만 오류(Bel

에이전트 5월 7일

LCM : 손실없는 컨텍스트 관리

LCM: 무손실 컨텍스트 관리 (Lossless Context Management, LCM) arXiv:2605.04050v1 발표 유형: 새로운 abstract 무손실 컨텍스트 관리 (LCM)이라는 determintic 아키텍처를 제시합니다. 이 아키텍처는 대규모 언어 모델(LLM) 메모리에서 Claude Code를 능가하는 성능을 보입니다. Opus 4.6을 사용하여 벤치마크한 LCM-augmented 코딩 에이전트, Volt는 OOLONG long-context eval에서 Claude C

AI 모델 5월 7일

LLM 지원 유연한 MCTS를 통해 자동화된 대규모 CVRP 솔버 디자인

대규모 CVRP(LSCVRP) 문제를 해결하는 것은 수백에서 수천개의 노드가 있는 경우에도 최신기술의 솔버에서도 여전히 어려운 문제입니다. 분할-정복 기법은 인스턴스를 크기가 줄어든 서브 문제로 분할하여 확장 가능하지만, 분할 논리 설계 및 서브 솔버 구성은 전문가와 노동력에 의존하는 labor-intensive한 작업입니다. 대규모 언어 모델(LLM)은 자동화된 알고리즘 설계에 유망한 도구로 등장했습니다. 그러나 현재 LLM를 기반으로 한 접근법은 LSCVRP를 해결하는 데 어려움을 겪고 있으며

AI 모델 5월 7일

큰 언어 모델의 여행 계획 능력 검토

여행 계획 기능을 향상시키기 위한 대규모 언어 모델(LLM)의 재검토 arXiv:2605.03308v1 발표 유형: 새로운 요약: 여행 계획은 장기적인 추론에 중요한 업무로 LLM의 심각한 한계를 노출한다. 그러나 기존의 벤치마크와 평가 방법은 종단에서 계획을 평가하는 방식으로, 해석의 불완전성과 실패의 근본 원인 분석이 어려운 문제를 보유하고 있다. 이 간극을 좁히기 위해, 여행 계획을 5개로 구성된 원자적 하위 기능으로 분리한다. 그 중에는 Constraint Extraction, Tool U

에이전트 5월 7일

에이전트 안전 판단 향상 : 조절 된 벤치마크 재 작성 및 배포 외의 속임수 시나리오에 대한 아날로그 이유

인공지능 요소의 안전한 판단을 높이기 위한 연구: 제어된 벤치마크 재작성 및 유사성 논리 reasoning을 통한 분포 이탈 시의 속임수 시나리오 arXiv:2605.03242v1 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)로 güç을 받는 도구 사용 인공지능 시스템은 웹, 앱, 운영 체제 및 거래 환경에서 점점 더 많이 배포되고 있습니다. 그러나 현재의 안전 벤치마크는 명시적 위험에 중점을 두고 있으므로 모델이 속임수 또는 모호한 경로를 판단할 수 있는 능력을 과대평가할 수 있습니다.

에이전트 5월 7일

cotomi 법: 당신을 바라보며 작업을 자동화하는 법을 배우기

cotomi Act: 사용자가 작업을 하면서 배우는 자동화 기술 cotomi Act는 브라우저 기반의 컴퓨터 사용 에이전트입니다. 이 에이전트는 사용자의 작업을 신뢰할 수 있는 다단계 작업 수행과 지속적인 조직적 지식 학습을 결합한 것입니다. 이 에이전트는 다음의 기술을 사용하여 179-작업 WebArena 인간 평가 집합에서 80.4%의 성능을 달성했습니다. - 적응적 느긋한 관찰 - 단어 차이 기반의 역사 압축 -粗细 계층 구조의 작업 - 테스트 시간에 대한 N 작업 선택 또한 co

AI 모델 5월 7일

LLM에서 결정적 계산을위한 권장 및 실행 기반 방법의 평가

대규모 언어 모델(LLMs)은 자연어 이해와 추론能力을 갖추고 있지만, 정밀하고 결정론적인 계산을 수행할 수 있는지는 불명확하다. 이 연구에서는 Chain-of-Thought(CoT), Least-to-Most 분해, Program-of-Thought(PoT), Self-Consistency(SC)와 같은 다수의 프롬프트 전략을 체계적으로 평가했다. 이 평가에는 정밀하고 오류가 없는 출력이 필요한 작업들이 포함되어 있으며, 이 작업에는 이진 카운팅, 가장 긴 부분 문자열 탐지, 산술 평가가 포함된

LLM PC 5월 7일

ADAPTS : 자동 프로토콜 - 증상 추적을 위한 에이전트 분해

감정 인식에서 부정적인 감정을 표현하는 임상적 추상 개념을 불특정 임상 상호 작용에서 모델링하는 것은 독특한 도전이다. 우리는 ADAPTS(대인적 분해를 위한 증상 추적에 대한 자동화된 프로토콜 무관 Framework, Agentic Decomposition for Automated Protocol-agnostic Tracking of Symptoms)라는 framework를 제시한다. 이 framework는 mixture-of-agents 대규모 언어 모델(LLM) 아키텍처를 사용하여 우울증과

AI 모델 5월 7일

엄격한 평가 없이 피어 리뷰를 자동화하는 것을 중지하십시오.

AI 시스템을 사용하지 않고 논문 검토를 자동화하지 말아야 한다. AI 시스템은 대규모 언어 모델(LLM)로 논문 검토를 해결하는 유혹적인 솔루션을 제공한다. 이 논문은 오늘날의 AI 시스템을 사용하여 논문 검토를 생산하는 것은 불필요하다고 주장한다. AI 시스템이 인간과 AI가 생성한 ICLR 2026 검토를 비교하고 AI 검토자에 대한 자동화된 논문 재작성의 효과를 평가하여 이 주장을 뒷받침한다. 이 연구에서 두 가지 중요한 문제점을 발견했다. 1) AI 검토자는 논문 내에서 과

에이전트 5월 7일

Terminus-4B : 더 작은 모델이 Agentic Execution 작업에서 Frontier LLM을 대체 할 수 있습니까?

Terminus-4B: 더 작은 모델이 프론티어 대규모 언어 모델(LLM) 대신 에이전트 실행 작업에서 대체할 수 있을까? 현대 코딩 에이전트는 특화된 서브태스크를 서브에이전트에 위임하는데, 서브에이전트는 좁은 책임을 맡는 더 작은 에이전트 루프이다. 이 아키텍처 패턴은 메인 에이전트의 컨텍스트 창을 깨끗하게 유지하기 위해 verbose 출력(예: 빌드 로그, 테스트 결과 등)을 서브에이전트 컨텍스트 내에 분리한다. 에이전트가 이러한 작업을 위해 서브에이전트를 사용할 때, 일반적으로 프론티어

AI 모델 5월 7일

사례에서 올바른 행동을 배우기 : 자율 에이전트에서 순차적 실행을 검증하기

자율적 에이전트의 순차적 행동을 검증하는 새로운 알고리즘을 제시했다. 이 알고리즘은 2-10개의 성공적인 실행 트레이스를 통해 올바른 행동을 자동으로 학습하고, 학습된 모델에 새로운 실행을 검증한다. 이 알고리즘은 컴파일러 이론의 도미네이터 분석 및 멀티모달 대규모 언어 모델-powered 의미 이해를 결합하여 필수 상태를 식별하고 비결정적 행동을 처리한다. 시스템은 Prefix Tree Acceptors를 사용하여 일반화된 ground truth 모델을 생성하고, traces를 다중 계층 적합성

AI 모델 5월 7일

LLM 기반 상징적 회귀를위한 프로그래밍 컨텍스트 증진

기호 회귀( Symbolic Regression, SR )는 주어진 데이터셋을 가장 잘 설명하는 수학적 표현식을 발견하는 과제로 과학적 발견의 근본적인 도전 중 하나입니다. 전통적인 접근 방식은 주로 유전 알고리즘과 관련된 진화적 방법에 기반을 두고 있으며 유용하긴 하지만 확장성과 표현력의 한계를 가지고 있습니다. 최근 기호 회귀에 대규모 언어 모델(LLM)-기반 진화적 검색 방법이 소개되었으며 좋은 결과를 보여주고 있습니다. 그러나 기존의 LLM 기반 접근 방식은 주로 평균 제곱 오차와 같은 스

AI 모델 5월 7일

Task-Based 팀 대화에서 정신 모델의 불일치를 감지하는 프레임워크

당신과 함께 하겠는가? 태스크 기반 팀 대화에서 정신 모델 불일치 감지 프레임워크 arXiv:2605.03149v1 발표 종류: 새로운 요약: 인간들은 일반적으로 자연어를 사용하여 팀원들에게 태스크 상태를 업데이트합니다. 모든 업데이트가 전달되지 않기 때문에 팀원들 사이의 정신 모델 불일치가 발생하여 팀의 전체 성과에 부정적인 영향을 미칩니다. 우리는 이러한 불일치를 어떻게 분류할 수 있을까요? 팀 대화에서 감지된 불일치가 미래의 정신 모델 불일치에 예측할 수 있나요? 전통적인 공유된 정신 모델(

연구 5월 7일

정 피곤와 관련검색인터넷어디서나수 있습다운로드 컴퓨팅 티레 선거와 그 일반화에 관한 규칙,가필니다.

컴퓨팅 티엘레 규칙에 대한 간격 선거와 그 일반화에 대한 연구 arXiv:2605.03067v1 발표 유형: 새로운 요약 승인 기반 위원회 투표가 사회적 선택 커뮤니티에서 받은 관심이 크다. 연구된 규칙 중 티엘레 규칙, 특히 비례 승인 투표(PAV)가 비례 대표성, 파레토 최적성 및 지지 단조성과 같은 바람직한 특성을 가지고 있다. 그들의 주요 단점은 티엘레 결과를 계산하는 것이 일반적으로 NP-완료이다. 희망의 한 가지 점은 구조화된 선호도 하에서 티엘레 규칙이 더 잘 동작한다는 것이다.

연구 5월 7일

보이지 않는 것을 눈에 띄게 만드는 것 : AI 채택에서 조직 목표와 직원의 경험 사이의 불일치 이해

인공지능(AI) 도입을 통해 조직의 혁신과 효율성을 높이기 위해 많은 조직에서 AI를 도입하지만, 많은 도입 시도가 실패하는 이유는 근로자들이 AI를 통합하기 위해 저항하고 Struggle하는 때문이다. 이러한 실패는 더 깊은 문제를 드러내는데, AI와 협력하기 위해 기대되는 근로자들은 AI의 설계와 사용 방식에 대한 결정에 불투명한 존재로 남아 있다. AI 시스템과 일상적으로 상호작용하는 의료, 금융, 관리 분야의 전문가와의 인터뷰를 바탕으로, 우리는 조직의 기대와 근로자의 경험 사이의 불일

LLM PC 5월 7일

안정적인 요원 제어 : 자율 사이버 방어를위한 도구 중재 LLM 아키텍처

안정적 행위자 제어: 도구 매개 LLM 아키텍처를 위한 자율적인 사이버 방어 안전한 결정-making을 위한 형식적 보장이 제공되지 않는 고위험 가치에 대한 대응을 필요로 하는 행위자 시스템을 위한 해결책이 필요하다. 보안 운영 센터(SOC)가 공격적인 압력을 받는 동안 끝점 감지 및 반응(EDR) 정책을 구성해야 하는 운영 환경에서 영감을 얻은 우리는 도구 매개 아키텍처를 제시한다: LLM 행위자가 결정론적 도구(스택엘버그 최적 반응, 베이즈 관찰자 업데이트, 공격 그래프 원소)를 사용하고 도

에이전트 5월 7일

CreativityBench : Affordance-Based Tool Repurposing를 통해 에이전트 Creative Reasoning을 평가하기

인공지능의 창의력 연구: 도구 재활용을 통한 사물 기능 기반 도구 사용 평가 arXiv:2605.02910v2 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)의 최근 발전은 추론 및 환경 상호작용과 같은 작업에서 좋은 성능을 나타냈지만 창의적 문제 해결 능력은 여전히 연구되지 않은 상태이다. 우리는 창의적 도구 사용을 통해 이 능력을 연구한다. 여기서 모델은 지식 기반에 있는 사물의 기능 및 특성에 대하여 논리적으로 사고하며, 일반적인 사용을 의존하지 않고 사물의 새로운 용도를 사용한다

연구 5월 6일

AI를 이용한 가능성의 주사위: 시간 계산의 시대

연구에서는 현재까지 AI 개발을 제한해 온 명사 기반 모델링 패러다임을 넘어, 동사 기반 패러다임을 소개하고, 가능성과 시간 계산의 정의를 제공한다. 이 연구는 3,276명의 유방암 환자들의 종단적 EHR 데이터에 적용하여, (1) 임상적으로 유의미한 환자 트레졸러리를 자동으로 발견하고, (2) 카운터페이탈 시간 계산을 수행한다. 이러한 결과는 완전히 데이터에 의존적이며, 이전 연구에서 보이지 않았던 기존 도메인 지식의 필요가 없는 결과를 보여준다.

에이전트 5월 6일

다중 에이전트 자율적 사고를 위한 수력학

대규모 언어 모델(LLM)로 구동되는 과학 워크플로우에서 단일 에이전트 시스템(SAS)은 기본 패턴이지만, 단일 컨텍스트 창 내에서 도구 사용 및 합성과 같은 경로 계획에 단점이 있다. 단일 에이전트 아키텍처의 컨텍스트飽和현상을 해결하기 위해, 저자는 수력학 분야에서 다중 에이전트 시스템(MAS) 프로토タイプ를 제시한다. 이 프로토タイプ는 Layer Execution Graph(LEG)로 에이전트를 협조시킨다. 계획 에이전트는 자연어 경로 힐리스트릭스에 기반하여 도메인 지식을 캡처하는 query-specific execution topologies를 생성한다. 전문가 에이전트는 엄격한 도구 허용 목록 내에서 작동하고, 대체 데이터 클래스 역할을 한다. 계층 간에, 합성 에이전트는 병렬 출력을 짧은 요약으로融合하고, 보고 에이전트는 최종 응답을 합성한다. 에이전트 실행 시, 런타임 로그는 모든 도구 호출에 대한 증명성을 지원한다.

인기 태그