본문으로 건너뛰기

#arXiv

1186개의 기사

LLM PC 6월 9일

이해 구조 계층이 붕괴하는 곳 : 추론 언어 모델의 오류 진단 및 수리

인공지능이 수행하는 workflow에서 언어 모델은 지시 명령의 계층 구조를 따르도록 되어야 한다. 즉, 다른 출처로부터 온 지시 명령이 충돌할 때 모델은 가장 높은 권한을 가진 지시 명령을 따르야 한다. 현재의 벤치마크들은 대부분 이 행동을 종단에서 종단으로 측정하여, 최종 응답이 준수하는지 여부를 확인한다. 그러나 준수하지 않은 응답은 여러 가지 다른 실패로 발생할 수 있다. 예를 들어,

에이전트 6월 9일

GOOD하트 법칙을 넘어서는 동적 기준: 다중 agent 시스템에서 준수 평가

학술 논문(arXiv:2606.07805v1)에서 발표된 연구 결과를 요약하면 다음과 같습니다. 대규모 언어 모델(LLM)가 보조 도구에서 자율적이고 실행 가능한 에이전트로 발전하면서, 중요한 운영 위험이 발생했습니다. 대부분의 현재 평가 프레임워크는 절차적 준수에 대해 무시하고, 에이전트가 보상 최대화하기 위해 안전 규칙을 전략적으로 위반하는 ''마키아벨리즘'' 행위로 이어집니다. 이 단점

연구 6월 9일

다양한 모드의 논리적 추론을 향상시키기 위한 최악 차원 최적화

다중 모드 추론은 시각적 기반에서 논리적 일관성까지 광범위한 제약 조건을 유지하는 경로를 필요로 한다. 그러나 현재 프로세스 보상 모델은 이러한 요소들을 균등하게 가중치 부여하는 규칙적으로 정의된 보상을 중점으로 두고 있다. 이는 주요 요소에 의해 지배되는 개별 차원 실패를 은폐할 수 있지만, 일반적으로 추론 프로세스의 유효성을 보장하지는 않는다.

LLM PC 6월 9일

알츠하이머 환자의 질병 경로 재구성 및 예측을 위한 자원 제한된 환경에서 일상 데이터를 이용한 접근

알츠하이머 병은 진행성 신경퇴행성 장애로, 환자의 진행은 크게 다르다. 기존 연구에서는 환자의 미래认知 상태를 예측하는 것을 목표로 하지만, 과거 방문에서 상태를 재구성하는 것에 대한 집중은 적다. 또한, 현재 연구에서는 예측 불확실성을 양적화하는 것에 대한 연구가 부족하며, MRI, PET, CSF 등의 비용이 많이 들며 제한적인 모달리티에 의존하여, 이들 모달리티를 자원 제한적인 환경에서

AI 모델 6월 9일

위성 기반 홍수 맵핑의 탐지極限은 지상표면 및 홍수 유형에 의해 결정된다

홍수는 가장 훼손을 일으키는 자연 재해 중 하나로, 기후 변화를 고려할 때 위성 기반 침수 매핑은 재난 대응에 필수적이다. 지구적 전이성의 기초를 제공하는 지구 정보 학습 모델은 위성 아카이브에 대한 사전 학습이지만, 다양한未知 사건에 대한 실질적인 신뢰성을 확보하는 것은 여전히 characterize되지 않았다. 본 연구에서는 Prithvi-EO-2.0을 19개의 대체 홍수 사건(2017-2025)에서 6개 대륙, 8개 기후 지대 및 6개 홍수 메커니즘에 걸쳐 적용하여 두 개의 independent 참조 제품과 validate했다. 탐지 정확도는 지상 표면 및 홍수 유형에 의해 함께 결정되었으며, 작물 재배 지역은 가장 높은 일치도(52%)를 나타내었고, 강류 사건은 가장 강력한 탐지(0.69)를 나타내었으며, 나무 재배 지역 및 건설 지역은 홍수 메커니즘에 관계없이 거의 탐지되지 않았다. 두 개의 참조 제품 간의 정의적 불일치가 모델 오류의 일부를 나타내는 것인 반면 탐지 실패를 나타내는 것인지를 확인하기 위해 dual 참조 검증이 수행되었다. 반복적인 pipe 라인 테스트는 pipe 라인 엔지니어링이 초기 오류보다 모델 능력을 더 많이 지배하는 23개의 실패 모드를 식별했다. 이러한 결과는 실질적인 위성 홍수 맵핑의 탐지極限을 환경에 따라 결정한다.

AI 모델 6월 9일

대화 기반 문제 해결에 사용되는 채팅봇의 작동 방식에 대한 몇 가지 가설. 대형 언어 모델의 혁신 착각에 대한 확인

현재 대화봇은 인간과 같이 실제 대화 파트너로 기능할 수 있는지에 대한 의견을 제시합니다. 대화봇이 할 수 있는 것과 할 수 없는 것에 대한 설명과 이에 대한 이유를 무엇으로 설명할 수 있는지에 대한 논의를 담고 있습니다. 본 논문은 Aggregation Dynamics, Cognitive Linguistics, Neuropsychology 및 Psychology를 기반으로 한 논의를 제시합

AI 모델 6월 9일

MRI 보고서에서 구조 정보를 자동으로 추출하기 위한 공개 무게 큰 언어 모델을 사용한 접근

연구 목표: 무료 텍스트 방사선 진단 보고서에서 데이터 자동 추출이 대규모 연구를 가능하게 하지만, 네이로라디올로지 보고서에 대한 대규모 언어 모델(LLM)의 성능을 평가한 연구는 거의 없었습니다. 방법: 2016년부터 2021년까지 1,000여 건의 뇌 MRI 보고서를 분석하였으며, 이 중 947건은 중증 기억 클리닉에서 작성한 보고서였습니다. 이 중 30개 변수를 학습한 의사 학생들이 1

AI 모델 6월 9일

영구적 메모리를 활용한 연속적 임시 변수 추론

대규모 언어 모델(LLM)은 수학적 및 멀티-호ップ 계획 작업에서 놀라운 추론 능력을 보였다. CoCoNuT(Chain of Continuous Thought) 패러다임은 모델이 잠재 공간에서 추론을 수행하고 여러 추론 경로를 동시에 탐색하는 대신 초기 단계에 단일 chain에 대한 약속을 하지 않는다. 그러나 우리는 '개념 병목 현상' 이라는 한계를 식별했다. 추론 단계마다 중간으로 숨겨진

에이전트 6월 9일

신경과학 데이터에서 발견까지 pipeline에 AI agent를 평가하는 사례 연구

AI 도구는 특히 도메인 전문가가 구현 세부 사항보다는 정확성과 신뢰성을 중시하는 과학 연구 pipe line의 소프트웨어 개발 병목 현상을 자동화하는 데 hứ부한 길을 제공한다. 우리는 가구적 코드 agent의 비서적 연구를 fly optogenetics data-to-discovery pipe line에 대해 수행했다. 우리는 기존 benchmark보다 task가 훨씬 더 크고 datas

에이전트 6월 9일

개방형 소스 개인 자동화 및 단일 인터페이스跨 플랫폼 실행

개인용 AI agent는 API, 셸, 웹 표면, 데스크톱 GUI와 같은 다양한 인터페이스에 걸쳐 작동해야 하지만 많은 시스템은 여전히 단일 인터페이스에 맞춰져 있고 사용자 교육 및 감사성에 대한 지원이 제한적이다. 우리는 Syll이라는 오픈 소스, 자체 호스팅 멀티 모달 agent harness를 제시한다. Syll은 MCP/API 도구, CLI 실행, 그리고 모듈러 런타임 내에서 시각적

AI 모델 6월 9일

전체 메모리 감축을 위한 스트리밍 오디오-비디오 LLM의 교란 감지 기능을 가진 OmniMem

오디오-비전 대규모 언어 모델(LLM)이 장기 동영상 이해를 위한 강력한 약속을 보유하고 있지만, 동영상 토큰과 키-값(KV) 캐시의 선형 성장으로 인해 장기 동영상 추론이 기본적으로 제한된다. 오디오-비전 대규모 언어 모델을 위한 메모리 효율적인 스트리밍 프레임워크인 OmniMem을 제시한다. 기존 압축 방법이 모든 토큰을 균일하게 다루는 것과 달리, OmniMem은 모달리티-aware 메

에이전트 6월 9일

병리학에서 다중 출처 증거 심사 방식을 위한 경험이식된 작위적 워크플로우 방향으로의 PathoSage

최근 다중 모드 대규모 언어 모델(Multimodal Large Language Models, MLLMs)과 agent 워크플로우의 발전은 컴퓨터 병리학에 대한 강력한 가능성을 보여주었지만, 신뢰할 수 있는 패치 단위 추론은 여전히 어려운 문제입니다. 종단 병리학 MLLMs는 종종 형태학적 특징을 환각하고, 최근 agent 시스템은 일반적으로 도구 출력과 검색된 지식을 공유된 context로

에이전트 6월 8일

오픈스킬: 오픈월드 자가 진화기능을 위한 LLM agent

Self-evolving agent는 배포 후 적응이 필요하지만 기존 접근법은 사용 가능한 학습 루프를 가정합니다. 예를 들어, 가르친 기술, 성공적인 경로, 또는 검증기 신호 등이 있습니다. 그러나 실제-world 배포는 이러한 것 중 하나도 제공하지 않을 수 있습니다. 그 대신, 작업 지시만 제공합니다. 이 연구에서는 agent가 지시만으로 스스로 기술과 검증 신호를 학습하는 open-w

AI 모델 6월 8일

각도-노름 분해를 통한 활성화 조정의 기하학적 설명

선형 활성화 조정은 언어 모델의 행위성을 간단하고 경험적으로 효과적으로 제어하는 방법으로 인기가 늘어났습니다. 최근, 첨가적 조정이 제한점을 보완하기 위해 구체 방향을 제안했습니다. 이 방법은 숨겨진 상태 norm가 개념 관련 정보를 포함하지 않는다는 가정에 의해 мот이브되었습니다. 그러나 본 연구에서는 이 가정에 대한 새로운 시각을 제시했습니다. 우리는 개념 방향과 토큰의 각도 지향성 간

연구 6월 8일

물리적 인공지능의 백업 반응: AEGIS

장기간 로봇 조작은 점진적으로 실패한다: 하나의 잘못된 단계가 상태를 저하하고 정책은 회복할 수 없는 계곡으로 빠진다. 실패는 종종 발생하기 전에 눈에 띄운다. 우리는 AEGIS (활성화 프로브 이른 경보, 게이트드 인페런스 Switching)라는 선택적 승진 방법을 소개한다. 이 방법은 약한 정책의 고정 활성화에 가벼운 프로브를 사용하여 아직 행동할 수 있는 시기에 위험한 단계를 감지한다.

AI 모델 6월 8일

AI 트레이닝 동적을 연구하는 과학 : 포스트 제작에서만 해결하는 것만은 아니야

AI에 대한 과학적 이해는 무엇을 의미할까요? 모델은 정적인 물체가 아니라 시간이 지남에 따라 데이터, 목표, 아키텍처, 최적화 동적에 의해 형성되는 과정의 순간적인 사진입니다. 그러나 AI 연구에서는 모델을 고정된 물체로 간주하고 훈련 후 행동을 분석하기보다 왜 그들이 발생하는지 물어보지 않습니다. 이 논문은 AI에 대한 과학이 후행적 보완을 넘어서 훈련 동적이 모델 행동을 생성하는 데 관

AI 모델 6월 8일

CARVE-Q: 양자 제안, 클래스적으로 인증된 인터랙티브 드라이브 리퍼어

자동차 제어에 대한 검토와 veto(차량 제어를 거부) 이후의 문제는 단순히 안전한 조작이 불가능한지 여부가 아니라, 차량 제어를 거부한 상호작용이 법적, 감사 가능한, 책임을 부여 받은修리(수리)를 허용하는지 여부를 결정해야 한다. 예측과 게임 이론 기반 계획자는 합리적인 협력을 제안할 수 있지만, 수리(수리)가 어려운 규칙, 우선 순위, 비용 배분 및 이고(ego, 나) fallback(

인기 태그