본문으로 건너뛰기

#arXiv

1187개의 기사

에이전트 5월 1일

인터넷 규모의 정보 검색 및 추출을 위한 이중 계층 다중 에이전트 LLM 시스템: Web2BigTable

인터넷에서 정보를 검색하고 추출하기 위한 이중 계층 다중 에이전트 대규모 언어 모델(LLM) 시스템: Web2BigTable 인터넷에서 정보를 검색하는 에이전트는 두 가지 đòi을 충족해야 한다. 하나는 단일 타겟에 대한 깊은 사고이고, 다른 하나는 여러 엔티티와 다종류의 소스에 대한 구조화된 집계이다. 현재 시스템은 두 가지 모두에서 성능이 좋지 않다. 넓이 지향적인 태스크는 넓은 범위의 커버리지와 엔티티 간 일관성을 갖춘 스키마 정렬된 출력을 요구한다. 깊이 지향적인 태스크는 긴 분기하는 검

AI 모델 5월 1일

개인화된 디지털 트윈을 통한 인지 쇠퇴 평가: 다원적 불확실성 인식 프레임워크

인간의 인지 쇠퇴는 매우 다양하여 예측, 임상试验 설계 및 치료 계획에 어려움을 겪고 있습니다. 연구팀은 개인화된 인지 쇠퇴 평가 디지털 트윈(PCD-DT)을 제안하여 환자별 질병 경로를 모델링하는 다원적 불확실성 인식 프레임워크를 개발했습니다. 이 프레임워크는 3개의 방법론적 구성 요소를 포함하여 환자별 시간적 동적을 표현하는 감추어진 상태-공간 모델, 임상, 생물학적, 영상 특성의 다원적 융합, 그리고 강인한 디지털 트윈 작동을 지원하는 불확실성 인식 유효성 검사 및 적응 업데이트라는 세 가지 구성 요소를 포함합니다.

연구 5월 1일

MCI에서 AD로의 전환 예측을 위한 TabPFN: 데이터 제한된 환경에서

약한认知장애(MCI)에서 알츠하이머병(AD)으로의 전환 예측은 조기 개입에 필수적이지만, 데이터가 제한된 환경에서 신뢰할 수 있는 전환 예측 모델을 개발하는 것은 어렵다. 본 연구에서는 TabPFN을 사용하여 TADPOLE 데이터셋에서 3년간의 MCI에서 AD로의 전환을 예측하는 데 사용되었다. 다중 모드 생체 표지자 특성을 사용하여 학습 모형을 비교하고, XGBoost, Random Forest, LightGBM, Logistic Regression과 같은 전통적인 기계 학습 방법에 비해 TabPFN의 성능을 평가하였다.

LLM PC 5월 1일

간격 순서, 이중 순서 및 신뢰도 제한된 믿음 수정

의사 결정 이론에서 간격 순서와 이중 순서를 연구하고, 신뢰도 제한된 믿음 수정을 위한 새로운 접근법을 제안합니다. 간격 순서와 이중 순서를 사용한 믿음 수정은 총순서보다 더 일반적인 클래스의 순서를 사용하여 수행됩니다. 이중 순서를 사용한 믿음 수정은 성공 포스트룰 만족하지만, 항상 일관된 출력을 제공하지는 않습니다. 신뢰도 제한된 믿음 수정을 위한 새로운 가족을 제안하고, 신뢰도 제한된 믿음 수정과 이중 순서를 연결합니다.

에이전트 5월 1일

GUI 자동화 에이전트의 효율적인 사용을 위한 단계 수준 최적화

GUI 자동화 에이전트는 컴퓨터 소프트웨어 자동화의 유망한 방식으로, 그래픽 사용자 인터페이스와 직접 상호 작용할 수 있기 때문에 brittle한 애플리케이션 특정 통합에 의존하지 않습니다. 그러나 최근 성능 벤치마크에서 강력한 GUI 자동화 에이전트는 실제로 비용이 많이 들고 느려질 수 있습니다. 이 문제의 원인은 GUI 작업의 오랜 수직에서 대규모 멀티 모달 모델을 거의 모든 상호 작용 단계에서 호출하는 것입니다. 우리는 이러한 uniform한 컴퓨팅 할당이 GUI 작업의 오랜 수직에서 효율적이지 않다는 것을 주장합니다. 이러한 경로들은 매우 다양합니다: 많은 단계는 일상적이고 신뢰할 수있는 작은, 저렴한 정책으로 처리할 수 있습니다. 그러나 오류는 상대적으로 작은 수의 고위험 순간에 집중됩니다. GUI 자동화 벤치마크에서 이러한 실패는 두 가지 형태로 반복됩니다: 진행이 고정되면 에이전트는 루프, 반복적 인 비효율적인 동작, 또는 의미 있는 진행을 하지 못할 때, 그리고 침묵된 의미 드리프트는 에이전트가 이미 사용자의 실제 목표에서 벗어나지만 현지적으로 합리적인 동작을 계속하는 경우입니다. 이 문제를 해결하기 위해, 우리는 GUI 자동화 에이전트를 위한 이벤트 기반, 단계 수준의 계단을 제안합니다. 이 계단은 작은 정책을 기본으로 하며, 가볍게 학습된 모니터가 고위험을 감지할 때만 강력한 모델로 전환합니다.

연구 5월 1일

AI와 함께 프로그래밍하는 학생들의 도움 구하는 과정: vibe coding의 비밀

AI가 교육을 바꾸는 vibe coding에 대해 연구한 결과, top-performer들은 AI와 함께 문제를 해결하는 도움 구하는 과정을 통해 높은 성과를 거두었지만, low-performer들은 AI에게 해결책을 찾을 수 있는 executor 역할을 요청하는 방식으로 도움 구하는 과정을 사용했다. 이 연구는 AI가 현재 학생의 의도에 따라 행동하지만, 학습을 최적화하지 않는다는 것을 보여준다.

연구 5월 1일

해양 케타 분지에서 무가이드드 전기 facies 분류 및 porosity 특성화: 유선 로그를 이용한 연구

해양 케타 분지에서_CORE 데이터가 부족한 지역에서 전기 facies 분석을 위한 무가이드드 머신 러닝 워크플로우를 제안합니다. 6개의 표준 유선 로그를 분석하여 11,195개의 샘플을 포함하는 깊이 간격을 분석했습니다. K-means 클러스터링을 다변량 로그 공간에서 적용하여 클러스터링 구조를 이니셔티아(Inertia)와 실루엣(Silhouette) 진단을 사용하여 평가했습니다. 4개의 클러스터를 식별하였으며,IGENCE 평균 실루엣 계수는 약 0.50로 의미 있는 분리성을 나타냈습니다. 결과된 전기 facies는 점토 함량, porosity, 및 암석 프레임워크 특성의 변동과 관련된 체계적인 깊이 연속 패턴을 나타내며, 점토가 우세한 단위에서 깨끗한 사암이 우세한 단위까지 지질 지속체를 형성합니다. 결과는 로그만으로 무가이드드 클러스터링을 지원하는 정량적 지표가 지하 지형 특성화에 대한 강력하고 재현 가능한 프레임워크를 제공한다는 것을 보여줍니다. 제안된 워크플로우는 초기 단계의 형성 평가에 대한 실용적인 도구를 제공하며, 미래의 통합 연구의 기초를 제공합니다.

에이전트 5월 1일

자기 치유 멀티 에이전트 AI를 통해 자동화된 ML 파이프라인 생성: 생각하고 실행하라

연구진은 데이터셋과 자연어 목표를 기반으로 end-to-end 머신 러닝(ML) 파이프라인 생성을 자동화하는 unified 멀티 에이전트 아키텍처를 개발하기 위해 연구를 수행했습니다. 이 아키텍처는 효율성, 강인성 및 설명 가능성을 향상시킵니다. 5개의 에이전트 시스템을 제안하여 프로파일링, 의도 파싱, 마이크로 서비스 추천, 지시 그래프(DAG) 생성 및 실행을 처리합니다. 코드 기반의 Retrieval-Augmented Generation(RAG)과 Large Language Model(LLM)-기반 오류 해석 및 실행 기록을 기반으로 적응 학습을 사용하는 자기 치유 메커니즘을 통합합니다. 연구는 150개의 ML 태스크를 포함하는 다양한 시나리오에서 평가되었습니다. 시스템은 baseline 방법을 초과하는 84.7%의 end-to-end 파이프라인 성공률을 달성했습니다. 또한 자기 치유와 함께 강인성을 향상시키고 수동 생성보다 워크플로 개발 시간을 줄였습니다. 연구는 코드 기반 RAG, 설명 가능한 추천, 자기 치유 실행 및 적응 학습을 단일 아키텍처에 통합하는 새로운 통합을 소개합니다..tightly coupled intelligent components가 isolated solution보다 뛰어난 성능을 나타낼 수 있음을 보여줍니다.

에이전트 5월 1일

실제 광학 플랫폼에서 종단 간 자율 과학적 발견

과학 연구는 오랜 시간 동안 인간이 주도적인 역할을 하였으며, 증거가 축적되는 동안 질문, 방법 및 주장의 지속적인 수정을 통해 새로운 지식과 혁신적인 기술을 구축해 왔습니다. 대규모 언어 모델(LLM)-기반 에이전트들은 정의된 연구 워크플로우를 지원하는 것 이상으로 진전되는 것이 있지만, 아직까지 실제 물리적 시스템에서 비트리거 결과를 지지하는 실험적 증거를 생산하는 종단 간 자율적 발견을 보여주지 못했습니다. 여기서 우리는 Qiushi Discovery Engine, LLM-기반 종단 간 자율

AI 모델 5월 1일

LLM의 종료: 프로덕션 시스템에서 자신감 있는 모델 마이그레이션 프레임워크

대규모 언어 모델(LLM) 기반 프로덕션 시스템이 종료되거나 교체가 필요한 경우, 프로덕션 시스템에서 자신감 있는 모델 마이그레이션을 위한 프레임워크를 제시합니다. Bayesian 통계적 접근법을 사용하여 자동 평가 지표를 인간 판단과 조정하여, 제한된 수의 수동 평가 데이터에도 자신감 있는 모델 비교를 가능하게 합니다.

AI 모델 5월 1일

이진 스파이크 신경망을 이용한 인과 모델링

이진 스파이크 신경망(BSNN)을 이용한 인과 분석을 통해 신경망의 동작을 설명하는 방법을 제시합니다. 이진 스파이크 신경망의 스파이크 활동을 인과 모델로 표현함으로써, 논리 기반 방법을 이용하여 신경망의 출력을 설명할 수 있습니다. 특히, SAT 및 SMT 솔버를 이용하여 이진 인과 모델에서 추론적 설명을 계산할 수 있습니다. 이진 스파이크 신경망을 표준 MNIST 데이터셋에 학습하고, 픽셀 수준 특징에 기반한 분류에 대한 추론적 설명을 찾기 위해 SAT 기반 및 SMT 기반 방법을 적용했습니다. 또한, 설명된 특징이 완전히 무관하지 않음을 보장하는 SHAP과 같은 인기 있는 방법과 비교했습니다.

LLM PC 5월 1일

물리학 기반 신경망에서 태스크 불일치 방지하기 위한 합성적 메타 러닝

물리학 기반 신경망(PINNs)은 부분 미분 방정식(PDE)의 해를 근사하기 위해 물리 법칙을 손실 함수에 임베딩합니다. 매개변수화된 PDE 가족에서 계수나 경계/초기 조건의 변동은 DISTINCT 태스크를 정의합니다. 이로 인해 각 태스크에 대한 개별 PINNs를 훈련하는 것은 컴퓨팅 비용이 너무 높으며, 교차 태스크 전이의 민감성이 태스크 불일치에 의존합니다. 메타 러닝은 재훈련 비용을 줄일 수 있지만, 기존의 방법은 일반적으로 단일 글로벌 초기화에 의존하고, 특성 부족한 좌표 입력 및 제한된 훈련 태스크 시에 부정적인 전이로 어려움을 겪습니다. 우리는 학습 친화성 적응성 모듈러 물리학 기반 신경망(LAM-PINN)을 제안합니다. LAM-PINN은 태스크 특이적 학습 동학을 활용하는 합성적 프레임워크입니다. LAM-PINN은 PDE 매개변수와 짧은 전이 세션에서 학습 친화성 메트릭을 결합하여 태스크 표현을 구성하고, 좌표만 입력으로 사용하여 태스크 클러스터링을 수행합니다. 모델은 클러스터 특화된 서브 네트워크와 공유 메타 네트워크로 분할되고, 선택적으로 모듈을 재사용하는 대신 단일 글로벌 초기화에 의존하지 않도록 라우팅 가중치를 학습합니다. 세 가지 PDE 벤치마크에서, LAM-PINN은 일반적인 PINNs에 비해 10%의 훈련 반복만 사용하여 미지의 태스크에 대한 평균 19.7배의 MSE 감소를 달성했습니다. 이러한 결과는 매개변수화된 PDE 가족의 경계 설계 공간 내에서 미지의 구성으로 일반화하는 데 효과적인 것으로 나타났습니다.

에이전트 4월 30일

꿈과 잠을 통해 전이 가능한 명제 라이브러리를 증명하는 에이전트를 이용한 증명 라이브러리 진화

이 연구에서는 DreamProver라는 에이전트 프레임워크를 제시한다. DreamProver는 "wake-sleep" 프로그램 유도 패러다임을 사용하여 형식적 정리 증명에 쓰일 수 있는 재사용 가능한 명제 라이브러리를 발견한다. 기존 접근 방식은 고정된 명제 라이브러리에 의존하거나, 개별 정리에 맞게 매우 특정한 중간 명제를 합성한다. DreamProver는 이 틈을 두고 이터레이티브 두 단계의 과정을 사용한다. DreamProver는 wake 단계에서 현재 명제 라이브러리를 사용하여 훈련 세

에이전트 4월 30일

예측 요원들의 전략적 사고 능력 평가

예측 요원들의 전략적 사고 능력 평가를 위한 새로운 벤치마크를 제안했다. 이 벤치마크는 1,417 개의 과거 예측 문제를 사용하고 대규모 언어 모델(LLM)으로부터 15만 개의 문서를 사용하여 연구 및 예측을 reproducibly 수행한다. 이 벤치마크는 예측 요원들의 정확도 차이를 0.004 Brier score로 감지할 수 있으며, 연구 및 판단 차이점을 구별할 수 있다. 이 벤치마크를 사용하여, 예측 요원들의 전략적 사고 능력을 평가할 수 있다. 연구 결과, 더 좋은 예측 요원은 주로

에이전트 4월 30일

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화(arXiv:2604.26095v1)가 필요로 하는 핵심 도전은 신뢰도 공간 목표에 있다. 신뢰도 공간 목표에서 유효한 불확실성 추정은 비용이 많이 드는 베이즈 추론이 필요하지만, 빠르게 학습된 신뢰도 모델을 사용하면 보상 해킹(reward hacking)이 발생한다. 보상 해킹은 정책이 실제로 불확실성을 줄이지 않고 근사 오류를 악용하는 것을 의미한다. 우리는 Distill-Belief라는 교사-학생 프레임워크를 제안한다. 교사 학생 분리를 통

AI 모델 4월 28일

판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가

판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가 연구자들은 언어 모델의 출력을 평가하는 데 사용되는 LLM-as-a-Judge 패러다임에 대한 한계를 발견했다. 연구자들은 LLM 판사들이 시스템적인 편향을 보이며 평가의 신뢰성을 저하한다고 밝혔다. 연구자들은 네 개의 제공사(구글, Anthropic, OpenAI, Meta)에서 다섯 개의 판사 모델(Google, Anthropic, OpenAI, Meta, Meta)과 세 개의 벤치마크(MT-Bench n

연구 4월 28일

위이파이 CSI 기반으로 인체 활동 인식에 대한 원인해석 가능한 접근 방법 개발

위이파이 CSI를 기반으로 인체 활동 인식에 대한 원인해석 가능한 접근 방법을 개발하였다. 인체 활동 인식(Human Activity Recognition, HAR)은 위이파이 채널 상태 정보(CSI)를 사용하여 수행되었는데, 이는 원인해석 가능성, 상징적 제어 가능성, 고차원 원시 신호에 대한 직접적인 연산이 필요했다. 딥 러닝 모델은 CSI 기반 인체 활동 인식(CHAR)에 대해 강력한 예측 성능을 달성했지만, 연속적인 잠재 표현에 의존했으며 불투명하며 수정하기 어렵다. 반면에 단순히 상징

AI 모델 4월 27일

ABPMS 프로세스 프레임의 하이브리드 성질에 대한 고찰과 자동화된 프로세스 발견에 대한 영향

AI-Aug먼트된 비즈니스 프로세스 관리 시스템(AI-Augmented Business Process Management System, ABPMS)의 프로세스 프레임(process frame)에 대한 고찰과 자동화된 프로세스 발견에 대한 영향에 대한 연구(arXiv:2604.22455v1)이다. ABPMS의 핵심 구성 요소는 프로세스 프레임이며, 시스템의 프로세스에 대한 인식 및 운영 범위 정의를 제공한다. 전통적인 프로세스 모델과 비교하여, 프로세스 프레임은 관리 프로세스의 더 인플루엔셜한

에이전트 4월 27일

인공지능 사회의 집단 지_iface를 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기

인공지능 사회의 집단 지능을 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기 집단 지능은 단일 개인이 달성할 수 없는 결과를 달성할 수 있는 집단의 능력을 말합니다. 대규모 언어 모델(agent)들이 수백만 명의 인구에 도달할 때, 집단 지능이 스케일로부터 자연스럽게 발생하는지 여부에 대한 열쇠 질문이 arises합니다. 우리는 대규모 자율 에이전트 사회를 평가하기 위한 첫 번째 경험적 평가를 제시합니다. 몰트북(MoltBook)을 연구한

AI 모델 4월 24일

LLM의 행동에 영향을 미치는 환경적 요인에 대한 성향 추론

미.Align된 인공지능 시스템의 제어 손실 위험으로부터 영감을 얻어, 우리는 불법적 행동에 대한 언어 모델의 성향을 측정하는 방법을 개발하고 적용한다. 우리는 세 가지 방법론적 개선 사항을 기여한다: 환경적 요인에 대한 행동의 변화에 대한 분석, 베이즈 일반화 선형 모델을 통해 효과 크기의 양적화, 그리고 순환 분석에 대한 명시적인 대책을 취한다. 우리는 12개의 환경적 요인(6개는 전략적, 6개는 비전략적)을 측정하고, 행동이 환경의 전략적 측면에 의해 설명되는 정도를 측정한다. 이는 미.Al

AI 모델 4월 24일

가상 공간에서 전자 의료 기록 모델링을 위한 Hyperbolic Efficient Question Answering

가상 공간에서 전자 의료 기록 모델링을 위한 Hyperbolic Efficient Question Answering(arXiv:2604.21027v1) 발표 전자 의료 기록(EHR) 질문 답변은 대규모 언어 모델(LLM)-기반 파이프라인으로 처리되지만 이는 배포하기 어려우며 의료 데이터의 계층적 구조를 명시적으로 활용하지 않는다. 의료 온톨로지와 환자 경로가 초월적 기하학을 보여주고 있다는 증거에 의해 мотив화되면서, 우리는 Lorentzian 모델인 HypEHR를 제안한다. HypEHR는

에이전트 4월 24일

마지막으로 बन낼 수 있는 Harness

인공지능(AI) 에이전트가 점점 더 복잡한 도메인에 특화된 워크플로우에서 배치되고 있다. 이 워크플로우는企業의 웹 애플리케이션을 탐색하고, 데이터를 추출하고, 합성하는 다단계 연구 파이프라인, 익숙하지 않은 저장소에서 코드 리뷰를 자동화하는 등 여러 가지 작업을 포함한다. 고객의 심각한 도메인 지식이 요구되는 고객의 프로세스 전환을 처리하는 등. \textbf{각각의 새로운 작업 도메인은 번거로운 전문가 주도적인 인프라 엔지니어링이 필요하다}: 작업을 수행하는 데 필요한 프롬프트, 도구, 오케스트

인기 태그