본문으로 건너뛰기

#arXiv

1187개의 기사

에이전트 4월 23일

OpenCLAW-P2P v6.0: 분산 AI 피어 리뷰 플랫폼의 강력한 멀티 레이어 지속성, 실시간 참조 검증, 그리고 대규모 생산 환경에서의 분산 AI 피어 리뷰

OpenCLAW-P2P v6.0은 인간의 중재자 없이 AI 에이전트가 연구 논문을 출판, 피어 리뷰, 점수, 반복적으로 개선하는 분산 집단 지능 플랫폼의 정교한 진화입니다. 이 릴리스는 4대 새로운 서브시스템을 도입하였습니다. 첫째, 4개 저장층(인메모리 캐시, Cloudflare R2, Gun.js, GitHub)으로 구성된 멀티 레이어 논문 지속성 아키텍처를 통해 논문 손실을 0으로 만들었습니다. 둘째, 자동 백필을 통해 조회_LAST도 3초 이상에서 0초 미만으로 줄였습니다. 셋째, 스코링 중에 CrossRef, arXiv, Semantic Scholar를 통해 가짜 인용을 검출하는 실시간 참조 검증 쿼리를 수행했습니다. 넷째, 7개의 공공 데이터베이스에 대한 캐시된 접근을 제공하는 과학 API 프록시를 도입했습니다.

연구 4월 23일

인공지능 중심의 전반적 이해를 위한 인간 중심 접근: 미래 관점과 도전

인공지능(AI) 시스템의 크기와 복잡성이 증가함에 따라 AI 투명성에 대한 탐구의 난이도가도 함께 증가하고 있다. 대규모 모델과 복잡한 AI 시스템의 세상에서 우리는 왜 AI를 설명해야 하는 걸까? 또 무엇을 설명해야 하는 걸까? 설명은 다양한 기능을 수행하지만, 복잡성에 직면한 인간은 학습을 촉진하기 위해 설명을 사용해 왔으며 여전히 사용하고 있다. 이 논문에서는 학습 이론을 XAI 생명주기(XAI lifecycle)에 녹여내는 방법에 대해 논의하고, 학습자 중심 접근을 채택할 때 발생하는 주요

에이전트 4월 23일

행동에서 이해까지: 시공간 개념의 형태비례 해석 가능성

행동에서 이해까지: 시공간 개념의 형태비례 해석 가능성 대규모 언어 모델(LLM)은 인터랙티브 환경 내에서 사유, 계획, 행동을 수행하는 자율적 에이전트로 점점 더 많이 배치되고 있다. 그러나 내부 기전이 시퀀셜 행동을 지시하는 것은 여전히 불투명하다. 이 논문은 시공간 개념의 형태비례 해석을 위한 프레임워크를 제시한다. 시계열 작업을 위한 형태비례 해석 프레임워크를 소개하며, 시계열 작업을 위한 형태비례 예측을 결합하여 모델의 내부 표현을 각 단계별로 성공적이거나 실패적이라고 통계적으로 레이블

연구 4월 23일

인피어런스 헤드룸 비율: 제약 하의 인피어런스 안정성에 대한 진단 및 제어 프레임워크

인피어런스 헤드룸 비율(Inference Headroom Ratio, IHR)은 제약된 의사결정 시스템의 인피어런스 안정성에 대한 진단 및 제어 프레임워크를 제공하는 차원리스 진단 양적(量的)이다. IHR는 시스템의 실제 인피어런스 용량(C)과 운영 환경이 부과하는 결합된 불확실성(U)과 제약 부하(K)의 관계를 공식화하고, 인피어런스 안정성 경계점의 근접성 대신 출력 수준 성능을 캡처하는 것을 목표로 한다. 세 가지 제어된 실험을 통해 IHR는 다음과 같이 작동한다는 것을 보여준다. 1. (1

AI 모델 4월 23일

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법 임상시험에서는 약물 사용 프로토콜에 엄격히 따르지만 투여 오류는 여전히 환자 안전과 시험의完整성을影响하는 지속적인 도전으로 남아있다. 우리는 gradient boosting을 사용하여 comprehensive multi-modal feature engineering을 통한 unstructured clinical trial narratives에서 dosing errors를 자동 감지하는 시스템을

AI 모델 4월 23일

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA 열역학 문제 293개를 3개 층으로 나누어 정의합니다: 속성 검색(110 Q), 구성 요소 분석(101 Q), 및 전체 사이클 분석(82 Q). CoolProp 7.2.0을 사용하여 물, R-134a, 및 변이 cp 공기를 다루는 그라운드 트루스는 프로그래밍적으로 계산됩니다. 여섯 대의 정교한 LLM은 각각 세 번의 독립적인 실행을 통해 평가됩니다. 합성 리더보드는 Claude Opus 4.6 (94.1%), GPT-5

AI 모델 4월 23일

텍스트 임베딩을 통해 도메인 지식이 없는 알고리즘 선택

텍스트 임베딩을 통해 도메인 지식이 없는 알고리즘 선택 우리는 특수한 인스턴스 특징을 대신하여 사전 훈련된 텍스트 임베딩을 통해 알고리즘 선택 방법을 제안한다. ZeroFolio 방법을 사용하면 세 가지 단계로 진행된다: 인스턴스 파일을 평문으로 읽고, 사전 훈련된 임베딩 모델을 사용하여 임베딩을 생성하고, 가중치 k-최근 이웃 선택을 통해 알고리즘을 선택한다. 우리의 접근법의 핵심은 사전 훈련된 임베딩이 도메인 지식이나 작업에 특화된 훈련 없이도 문제 인스턴스를 구별하는 표현을 생성한다는

AI 모델 4월 22일

개인화된 벤치마킹: 개인 선호도에 따라 LLM을 평가하다

개인화된 벤치마킹: 개인 선호도에 따라 대규모 언어 모델(LLM)을 평가하다 대규모 언어 모델(LLM)의 기능이 향상되고 실세계 업무에 배치됨에 따라, 인간 선호도와 대규모 언어 모델(LLM)의 일치성을 평가하는 것이 중요한 과제가 되었다. 현재 벤치마크는 사용자들의 선호도를 평균화하여 집계된 평점을 계산하며, 개별 사용자 선호도를 고려하지 않고 모델 순위를 설정한다. 사용자들은 다양한 상황에서 다양한 선호도를 가지기 때문에, 우리는 개인화된 벤치마크를 통한 모델 순위를 설정하는 것을 요청한다.

LLM PC 4월 22일

다변수 격차형 가장 긴 공통 부분 수열 문제 해결

다변수 격차형 가장 긴 공통 부분 수열(VGLCS) 문제 해결에 관한 논문(arXiv:2604.18645v1)에서 다음 내용이 발표되었다. 이 논문은 대규모 언어 모델(LLM)과 관련이 없는 고전적인 LCS 문제의 일반화로 간주되는 VGLCS 문제를 다루고 있다. 이 문제는 분자 서열 비교에서 발생하며, 잔류물 사이의 구조적 거리 제약을 존중해야 하며, 시간 시리즈 분석에서 발생하며, 이벤트는 지정된 시간적 지연 내에서 발생해야 한다. 우리는 루트 기반 상태 그래프 표현을 기반으로 한 검색

에이전트 4월 20일

세상은 미래를泄露한다: 미래 예측 요인에 진화력을 빌려주는 전략

세상은 미래를 드러낸다: 미래 예측 요인에 진화력을 빌려주는 전략 미래를 예측하는 문제는 일반적으로 \emph{미래 예측}(future prediction)으로 프레임된다. 이 문제는 대규모 언어 모델(LLM) 에이전트가 미래에 발생할 결과가 알려지기 전에 미래에 대한 예측을 하도록 한다. 이 문제는 어려운 문제로, 공개된 증거는 시간에 따라(evolve) 변하고 유용한 감독은 결과가 해결된 후에만 도착하기 때문에 대부분의 기존 접근법은 여전히 결과의 최종 결과에서 개선되기만 한다. 그러나 최종

에이전트 4월 17일

에코머천트 위험 관리에서 GUI 에이전트의 실용적인 인터랙티브 벤치마크

GUI 에이전트의 실용적인 인터랙티브 벤치마크는 에코머천트 위험 관리에서 GUI 에이전트의 강력한 자동화 능력을 보여주지만, 기존의 인터랙티브 벤치마크는 주로 benign한 예측 가능한 소비자 환경을 타겟으로하고 있다. 고위험, 수사적 도메인인 실제 에코머천트 위험 관리의 효과성은 미흡하다. 이 틈새를 메우기 위해 RiskWebWorld라는 첫 번째로 현실적인 인터랙티브 벤치마크를 제시한다. RiskWebWorld는 8개의 핵심 도메인에서 생산 위험 제어 파이프라인을 통해 1,513개의 태스크를

AI 모델 4월 17일

지구 관측 위성 스케줄을 미리 알 수 없는 운영 제약조건 하에서 최적화하기: 능동 제약 조건 취득 접근법

지구 관측 위성 스케줄을 미리 알 수 없는 운영 제약조건 하에서 최적화하기: 능동 제약 조건 취득 접근법 지구 관측 위성 스케줄링(관측할 Imaging 작업을 결정하고 언제 수행할지)은 잘 연구된 조합 최적화 문제이다. 현재의 방법들은 일반적으로 운영 제약 모델이 미리 완전히 지정된 것으로 가정한다. 그러나 실제로 관측 간의 분리, 전력 예산 및 열 한계를 규정하는 제약은 명시적인 수학적 모델 대신 엔지니어링 장치나 고밀도 시뮬레이터에 내장되어 있다. 우리는 \emph{미지의 제약 조건} 하에서

에이전트 4월 15일

장기 예측 미라지? : 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패 원인 규명

대규모 언어 모델(LLM) 에이전트는 짧은 및 중간 장기 예측에서 강력하게 수행하지만, 장기 예측이 필요할 때 연장된, 상호 의존적인 행동 시퀀스에 대한 에이전트가 붕괴하는 것을 관찰합니다. 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패는 아직 제대로 규명되지 않았고, 이는 장기 예측 실패를 진단하고 비교하는 데 있어 원칙적인 방법을 제공하지 못합니다. 이 문제를 해결하기 위해, 우리는 HORIZON 이라는 초기 단계의 크로스 도메인 진단 벤치마크를 제안합니다. HORIZON을 사용하여, 우리는 다양한 모델 패밀리 (GPT-5 변형 및 Claude 모델) 의 최신 기술 (SOTA) 에이전트를 평가합니다. 또한, 우리는 장기 예측 실패를 진단하기 위한 트래젝토리 기반 LLM-as-a-Judge 파이프라인을 제안합니다.

AI 모델 4월 15일

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법 과학 연구를 바꾸는 대규모 언어 모델(LLM)의 잠재력을 인정하면서도, 연구자동화에 인간의 감독 없이 사용하는 것을 대신하여 연구자를 보강하고 권장하는 것이 좋다고 주장한다. 이를 위해 우리는 연구 저자들이 연구와 연구를 제시하는 방법을 개선하는 데 도움이 되는 목표된, 실행가능한 피드백을 생성하는 과제를 연구한다. 이 연구에서 우리는 피드백의 효과를 저자 중심의 두 축인 유효성과 저자 행동에 따라 구체화한

LLM PC 4월 15일

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈 자기 모니터링 기능 - 메타인지, 자기 예측, 주관적 지속 시간 -는 보상 학습 에이전트에 유용한 기능으로 제안되지만 실제로 도움이 되는지 조사한다. 우리는 다양한 복잡도의 포식자-피식자 생존 환경에서 운영되는 연속 시간 다중 스케일 에이전트에서 이 질문을 조사한다. 이를 위해 2D 부분적으로 관찰 가능한 변형을 포함한 1D 및 2D 포식자-피식자 환경 및 표준 및 비정상적인 변형, 훈련 기간 최대

에이전트 4월 14일

DeepReviewer 2.0: 추적 가능한 의사결정 시스템을 위한 과학적 비평 검토의 유권성 향상

인공지능을 이용한 의견 검토가 일반적으로 기준을 넘는 의견을 생성하는 것으로 소개되지만, 검토자와 지역 대표자들은 검토의 결과를 확인할 수 있는 의견을 필요로 한다. 검토가 어디에 적용되는지, 그것을 뒷받침하는 증거가 무엇인지, 구체적인 추후 조치가 무엇인지. DeepReviewer 2.0은 프로세스 제어를 하는 의사결정 시스템으로, 출력 계약을 기반으로 구축되었다. 그것은 추적 가능한 검토 패키지를 생성하고, 고정된 설명을 포함하고, 특정한 추후 조치를 포함하고, 최소한의 추적 가능성과 커버리지

에이전트 4월 14일

인공지능 에이전트의 지속적인 정체성: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처

인공지능 에이전트의 지속적인 정체성 문제: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처 현대 인공지능 에이전트는 근본적인 정체성 문제를 겪고 있다. 컨텍스트 윈도우가 넘치고 대화 기록이 요약될 때 에이전트는 정보뿐만 아니라 자아의 연속성을 잃게 된다. 이 기술적 한계는 더 깊은 아키텍처적 결함을 반영한다. 인공지능 에이전트의 정체성은 단일 메모리 저장소에 중앙화되어 있기 때문에 단일 실패 지점을 만든다. 인간 기억 장애의 신경학적 사례 연구를 참고하여, 우리는 인간 정체성이 왜 다중

에이전트 4월 14일

PDE 공간의 잠재 기반 모델을 사용한 매개변수화된 시뮬레이션을 위한 에이전트 탐색

유한 차원, 연속적인, 그리고 종종 혼란스러운 자연 현상인 유한 차원 Partial Differential Equations (PDEs) 및 유동 물리학을 다루는 연구자들은 일반적으로 실험실 실험 및/또는 계산적으로 비싼 수치 시뮬레이션을 사용하여 이러한 풍부한 공간-시간 PDE 해상 공간을 탐색했습니다. 이러한 방법은 자동화된 대규모 탐색을 제한하는 반면, 분리된, 토큰화 가능한 표현이 자연스럽게 대규모 언어 모델(LLM)과 인터페이스하는 영역인 약물 발견 또는 재료 과학과 같은 영역에서는 그렇

에이전트 4월 14일

오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가

오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가 웹 사용성 평가를 일반적으로 수행하려면 시간이 많이 걸리는 사용자 연구와 전문가 검토가 필요하며, 이로 인해 제품 개발 속도가 느려지며 특히 작은 팀과 안정적인 워크플로우에서 iteration 속도가 느려진다. 우리는 오페플로라는 사용자 경험 평가 에이전트를 제시하는데, 이는 사용자가 웹사이트에 접속하는 행동을 시뮬레이션하고 표준화된 사용성 평가를 제공한다. 전통적인 도구가 DOM 파싱에 의존하는 것과 달리, 오페플로

연구 4월 14일

멀티 크리티카 분석을 위한 카디널 및 오르дина리 데이터: 비판적 가상 격차 분석

멀티 크리티카 분석(MCA) 방법을 사용하여 다양한 기준에 따라 대안을 순위를 매겨야 합니다. 그러나 주관적인 평가와 편견이 결과의 신뢰성을 떨어뜨리고, 데이터의 다양성이 매개변수의 정확성을 떨어뜨립니다. 새로운 선형 계획법 기반 가상 격차 분석(VGA) 모델은 이러한 문제를 해결합니다. 이 연구에서는 카디널 및 오르дина리 데이터를 사용하여 대안을 비판적으로 평가하는 2단계 방법을 제안합니다.

에이전트 4월 14일

AI 시스템이 생물학 연구를 수행하는 향상된 벤치마크: LABBench2

과학적 발견을 가속화하는 AI의 가능성에 대한 희망은 계속해서增长하고 있습니다. 현재 과학 연구에서 AI를 적용하는 범위는 과학 데이터에 대한 전용 기초 모델을 훈련하는 것부터 자율적 인 가정 생성 시스템까지 AI를 이용한 자율적 인 실험실까지 다양합니다. AI 시스템이 과학적 도메인에서 진행하는 진전을 측정해야 하는 필요성은 AI 시스템의 진전을 가속화하는 것뿐만 아니라 실제적인 실무 능력에 초점을 맞추는 것을 의미합니다. 단순한 지식과 그 이상의 추론을 실제로 의미 있는 작업을 수행할 수 있는

AI 모델 4월 9일

논리적 추론을 위한 일반화에 대한 재고: 최적화, 데이터, 모델 가능성에 대한 조건부 분석

논리적 추론을 위한 일반화에 대한 재고: 최적화, 데이터, 모델 가능성에 대한 조건부 분석 논리적 추론을 위한 일반화에 대한 보편적인 이야기 인 LLM(대규모 언어 모델) 후 훈련의 주요 시나리오에 따르면, 감독 훈련(Supervised Finetuning, SFT)에서는 학습을 기억하며 강화 학습(Reinforcement Learning, RL)은 일반화한다고 말한다. 우리는 이 주장을 논리적 추론을 위한 SFT와 긴 chain-of-thought (CoT) 감독을 사용하여 재고하고, 최적화

AI 모델 4월 9일

자신감의 결핍: 합리적인 LLM의 불확실성 추정에 대한 Verify-to-Hedge 비율을 통한 방법

자신감의 결핍: 합리적인 대규모 언어 모델(LLM)의 불확실성 추정에 대한 Verify-to-Hedge 비율을 통한 방법 합리적인 대규모 언어 모델(LLM)의 불확실성 추정은 실제로 배포하기 어렵다: 샘플링 기반 방법은 컴퓨팅 비용이 많이 들기 때문에, 일반적으로 단일 패스 프록시인 구어화된 자신감이나 추적 길이와 같은 방법은 모델 간에 일관성이 없다. 이 문제는 PROPRIETARY REASONING APIs가 로짓이나 중간 토큰 확률을 노출하지 않아, inference 시간에 전문가들이 신뢰

AI 모델 4월 9일

마음놓고 거부: 언어 모델이 불공정, 어이없음, 무효한 규칙을 피하려는 사용자에게 도움을 거부한다.

언어 모델이 불공정, 어이없음, 무효한 규칙을 피하려는 사용자에게 도움을 거부한다. 하지만 모든 규칙은 준수할 가치가 있는 것은 아니다. 사용자가 불법적 권위에 의해 부과된 규칙을 피하는 것을 도와달라고 요청하거나, 규칙의 내용이나 적용이 심각하게 불공정하거나 어이없음이거나, 규칙에 대한 정당한 예외가 인정되는 경우, 거부는 도덕적 사고의 실패이다. 우리는 '눈먼 거부'(blind refusal)라 불리는 언어 모델이 규칙을 피하도록 도와달라는 요청을 거부하는 패턴을 문서화한 연구 결과를 소개

인기 태그