본문으로 건너뛰기

#arXiv

1187개의 기사

에이전트 5월 20일

긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크: DecisionBench

DecisionBench는 긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크이다. DecisionBench는 작업 집합(GAIA, tau-bench, BFCL multi-turn), 동료 모델 풀(11 모델, 7 벤더 가족), 위임 인터페이스(call_model와 읽기 프로파일 채널의 옵션), 결정론적 스킬-ANNOTATION 레이어, 품질, 비용, 지연 시간, 위임률, 라우팅 신뢰도-at-k, 벤더 자체 선호도, 그리고 카운터팩토럴 위임 천장으로 구성된 다중 축 메트릭 스위트를 포함

AI 모델 5월 20일

시스템 프롬프트 최적화에 대한 연구: 동적 표현을 통한 베이즈 최적화

시스템 프롬프트는 현대 AI 시스템의 중심 제어 메커니즘으로, 대화, 작업 및 사용자 인구를 통한 행동을 형성합니다. 그러나 피드백이 예시별 레이블, 오류 또는 비판이 아닌 집계 메트릭으로만 제공되는 경우 프롬프트를 조정하는 것이 어렵습니다. 본 연구에서는 집계 피드백 설정을 단순화된 블랙박스 최적화로 연구합니다. 이 연구에서는 ReElicit, 베이즈 최적화 프레임워크를 소개합니다. ReElicit는 대규모 언어 모델(LLM)을 사용하여 compact하고 해석 가능한 특성 공간을 유도하고 프롬프트를 이 특성 공간으로 매핑합니다. 확률적 가우시안 프로세스 서브레이트를 사용하여 수집된 프롬프트 점수를 기반으로 acquisition 함수는 목표 특성 벡터를 선택하고 LLM은 이를 구현하고 최적화하여 배포 가능한 시스템 프롬프트로 만듭니다. 새로운 평가가 도착할 때마다 특성 공간을 재엘리시트하여 관찰된 프롬프트-점수 역사에 따라 표현을 적응시키는 것이 가능합니다.

AI 모델 5월 20일

인터페어런스-어웨어 멀티태스크 언러닝

인터페어런스-어웨어 멀티태스크 언러닝은 기존의 단일 태스크 설정에서만을 위한 언러닝 방법을 개선하여, 다중 태스크 환경에서 모델의 학습 데이터를 제거하는 방법을 제안합니다. 이 방법은 전체 태스크 언러닝과 부분 태스크 언러닝 두 가지 설정을 제공하며, 태스크 간의 간섭을 줄이고 모델의 성능을 유지하는 것을 목표로 합니다.

에이전트 5월 20일

신뢰할 수 있는 에이전트 네트워크: 에이전트 네트워크에 신뢰를 구축해야, 부착할 수는 없다

대규모 언어 모델(Large Language Model, LLM) 기반의 자율 에이전트가 복잡한 추론과 실행을 가능하게 한 결과, 에이전트 간 협력 네트워크가 등장하고 있다. 이러한 네트워크는 단일 에이전트가 전체 작업을 수행하는 것보다 작업 성능이 좋아 보이지만, 현재 에이전트 정렬 기술로는 존재하는 시스템 취약성, 즉 적대적 합성, 의미 불일치, 연쇄적 운영 실패를 해결할 수 없다. 이 비전 논문에서는 에이전트 간 협력 네트워크의 신뢰성을 보장하기 위해 기존 프로토콜에 retrofitting하는 것만으로는 충분하지 않으며, 네트워크 협력 프레임워크의 시작부터 신뢰성을 설계해야 한다고 주장한다.

LLM PC 5월 20일

KAN-MLP-Mixer: 시계계량기 기반 인간 활동 인식 모델을 개선하는 Kolmogorov-Arnold Networks (KANs) 조사

KANs는 깨끗하고 저차원 데이터에서 복잡한 함수를 학습하는 데 뛰어난 능력을 보이지만, 노이즈와 불완전한 실세계 데이터셋에서 성능을 유지하는 데 어려움을 겪고 있습니다. 반면, 전통적인 다층 퍼셉트론 (MLPs)은 노이즈에 대한 내구성을 보장하고 계산 효율성을 제공합니다. KANs를 HAR 모델의 모든 MLP 구성 요소로 대체하면 정확도와 계산 효율성이 저하되는 문제를 해결하기 위해, 우리는 깊은 HAR 네트워크 내에서 KAN 모듈의 다양한 배치를 시스템적으로 탐구하고, KAN-MLP 하이브리드 아키텍처를 제안합니다. 이 아키텍처는 KAN 기반 입력 임베딩 레이어를 사용하고, 중간 특성 혼합을 위해 MLP 레이어를 유지하고, 최종 활동 분류를 위해 특수화된 LarctanKAN 모듈을 소개합니다. 8개의 공개 HAR 데이터셋에서, 하이브리드 KAN-MLP 모델은 순수 MLP 모델에 비해 평균 macro F1 점수 상대 향상률 5.33%를 달성하고, 독립된 KAN 및 MLP 기준선보다显著히 성능을 개선합니다. 또한, 이 하이브리드 전략을 다른 최신 HAR 아키텍처에 통합하면, 그들의 성능을 지속적으로 향상시킵니다.

에이전트 5월 20일

대화형 자연어 질문을 SQL로 변환하는 일반 용도 에이전트: AgentNLQ

대화형 자연어를 SQL로 변환하는 문제는 연구자와 기업에게 중요한 문제로, 관계형 데이터베이스가 광범위한 실용적인 문제에 중요한 역할을 하기 때문이다. 대규모 언어 모델(LLM)의 능력 향상에도 불구하고, 대화형 자연어를 SQL로 변환하는 문제는 인간 전문가 SQL 작가와의 정확도 면에서 여전히 열린 문제로, 추가적인 개선이 필요하다. 이 연구에서는 대화형 자연어를 SQL로 변환하는 새로운 다중 에이전트 방법을 제시한다. 이 방법은 78.1%의 의미적 정확도를 달성하는 BIg Bench for LaRge-scale Database (BIRD) 벤치마크에 대해 평가되었다. 이 연구의 주요 기여는 다음과 같다: (a) 다중 에이전트 솔루션에서 최적화된 새로운 오케스트레이터를 설계하여 LLM을 사용하여 계획, 오케스트레이션, 반영, 자체 교정하여 정확한 SQL 쿼리를 생성한다. (b) 고급 스키마 enrichment 방법을 개발하여 정확성을 향상시키기 위해 계층 구조 메타데이터를 생성한다. (c) BIRD-SQL 벤치마크에서 다중 도메인과 데이터셋에 대한 정확성과 일반화성을 평가하여 정확성과 일반화성을 보여준다.

AI 모델 5월 20일

학습-밴드-스트레스 하에서 안정성과 효율성을 위한 한계自治 학습 제어 관할

대규모 언어 모델(LLM) 학습이 점점 더 불안정해지고, 낮은 성능과 낭비된 컴퓨팅이 발생하고 있습니다. Learn-by-Wire Guard(LBW-Guard)는 AdamW 위에 작동하는 한계自治 학습 제어 관할 계층을 소개합니다. LBW-Guard는 최적화 업데이트 규칙을 대체하는 대신, 학습 전송을 관찰하고 불안정성에 민감한 영역을 해석하여 최적화 실행에 한계 제어를 적용합니다. LBW-Guard는 WikiText-103에서 Qwen2.5-centered stress-and-robustness suite를 사용하여 Qwen2.5-7B를 empirical anchor로 평가합니다. Qwen2.5-3B와 Qwen2.5-14B와의 모델 크기 비교, 학습률 스트레스 테스트, 기울기 클리핑 베이스라인, TinyLlama-1B의 전체 매개변수 절대 안정성 검사도 수행합니다. 7B 참조 설정에서 LBW-Guard는 최종 혼동도 13.21에서 10.74로 개선되어 18.7% 향상되며, 종단 간 시간이 392.54s에서 357.02s로 1.10배 가속됩니다. 더 강한 학습률 스트레스에서 AdamW는 LR=3e-3에서 1885.24 최종 혼동도와 LR=1e-3에서 659.76로 감소하지만, LBW-Guard는 11.57와 10.33으로 유지됩니다. 기울기 클리핑 베이스라인은 이 효과를 재현하지 못합니다. 이러한 결과는 안정성에 민감한 LLM 학습이 최적화자 위에 관할 평면을 가지는 데 이점이 있다는 scoped 시스템 결론을 지지합니다. LBW-Guard는 한계 런타임 제어가 스트레스 하에서 효율적인 컴퓨팅을 유지하면서 최적화자 대체와 지역 기울기 억제와 구별되는 증거를 제공합니다.

AI 모델 5월 20일

개인건강기록을 활용한 맞춤형 건강 AI의 유효성 평가

개인건강기록을 활용한 맞춤형 건강 AI의 유효성 평가 개인 관리형 개인건강기록(Patient-managed Personal Health Records, PHR) 은 환자가 자신의 건강을 더 잘 이해할 수 있도록 권한을 부여하지만, 기록에 있는 정보는 복잡하여 통찰력을 방해할 수 있다. 이 연구에서, 우리는 환자 질문에 대한 도움이 되는 답변을 제공할 수 있는 대규모 언어 모델(LLM, Gemini 3.0 Flash)의 잠재력을 평가하기 위해 PHR에서 클리닉 데이터를 컨텍스트로 제공할 때 평가했

AI 모델 5월 20일

문서 AI를 운영화하는 방법: OCR 및 LLM 파이프라인을 프로덕션에서 운영하는 마이크로서비스 아키텍처

문서 이해를 위한 새로운 모델을 연구하는 학술 연구는 모델 정의와 프로덕션 규모에서 모델을 실행하는 격차를 메우기 위해 마이크로서비스 아키텍처를 제시합니다. 이 아키텍처는 분류, OCR, 대규모 언어 모델(structured field extraction) 파이프라인을 포함합니다. 이 아키텍처를 프로덕션에서 운영하면서 우리의 경험을 공유합니다.

AI 모델 5월 20일

데이터 프로브를 통해 LLM 성능에 미치는 데이터의 본질을 이해하는 방안

대규모 언어 모델(LLM)의 성능에 영향을 미치는 데이터의 본질을 이해하는 것은 여전히 개방된 문제로, 현재의 접근 방식은 대규모 공개 데이터 세트에 대한 실험적 연구에 의존하고 있습니다. 이에 본 논문에서는 데이터 프로브를 개발하여 LLM의 학습, 튜닝, 정렬, 인컨텍스트 학습 등 다양한 단계에서 데이터의 특성에 미치는 영향을 시스템적으로 연구하고자 uzun합니다.

연구 5월 19일

세계-지역 그래프 주의도 네트워크: 교통 예측을 위한 새로운 접근법

교통 예측은 지능형 교통 시스템의 중요한 부분입니다. 교통 예측의 주요 도전 중 하나는 시공간 상의 상관관계를 찾는 것입니다. 최근 그래프卷积 네트워크와 그래프 주의도 네트워크가 전통적인 통계 모델을 대체하여 미래 교통을 예측하는 데 사용되었습니다. 그러나 두 가지 모두 모든 꼭짓점이 매우 다른 특성을 가질 수 있는 것을 허용하는 것이 복잡합니다. 이러한 문제를 해결하기 위해, 우리는 쌍별 인코딩과 이벤트 기반 인접 행렬을 사용하여 세계-지역 그래프 주의도 네트워크(GLGAT)를 제안합니다. GLGAT는 꼭짓점이 전체 그래프에 대한 글로벌 주의도 행렬 집합을 가질 수 있도록 허용하고 각 꼭짓점에 대한 지역 주의도 행렬 집합을 할당합니다. 두 개의 실제 교통 데이터 세트에 대한 실험 결과, GLGAT는 시공간 상의 상관관계를 효과적으로 캡처하고 다른 최신 표준 기반이나와 경쟁적인 성능을 나타냅니다.

에이전트 5월 19일

바바 인 원더랜드: 실행 가능한 월드 모델을 위한 온라인 자가监督 동역학 발견

바바 인 원더랜드: 온라인 자가 학습 동역학 발견을 위한 실행 가능한 세계 모델 실행 가능한 세계 모델은 읽을 수 있고, 편집할 수 있으며, 실행할 수 있으며, 계획을 위해 재사용할 수 있지만, 프로그램이 환경의 전이 법칙을 캡처하기보다는 표면 언어의 의미적 단축을 캡처하지 않는다면만 가능하다. 우리는 표준화된 규칙 설명, 보상 신호, 신뢰할 수 있는 어휘 전제가 없이 상호 작용 증거만으로 상태 종속 동역학을 유도해야 하는 에이전트가 온라인 실행 가능한 세계 모델 학습을 하는 경우를 연구한다.

AI 모델 5월 19일

GRID: 보안 텍스트 지식 그래프 구축을 위한 지능 데이터 그래프 표현

보안 지식 그래프를 구축하는 것은 어려운 작업으로, 보안 도메인 지식이 부족한 대규모 언어 모델(LLM)와 end-to-end 문서-그래프 훈련이 어려운 문제가 있습니다. GRID은 보안 텍스트 지식 그래프 구축을 위한 end-to-end 프레임워크입니다. GRID은 CTI 기사에서 보안 도메인 감독을 생성하기 위해 그래프 추출과 지식 그래프 조건에 의한 텍스트 수정을 통해 추적 가능한 기사-그래프 정렬을 만듭니다. 그리고 문서-그래프 학습을 스크립트된 태스크 뱅크로 변환하여, 4 옵션 멀티 셀렉트 질문과 트리플 레벨 정규 표현식 매칭 타겟을 결합하여, LLM 판독기와 반복적으로 전체 그래프 출력을 스코어하는 것보다 더 안정적인 태스크 스페시픽 보상을 얻을 수 있습니다.

LLM PC 5월 19일

반납만큼 충분하지 않다: 개인화된 언어 시스템의 약속 범위 설정

개인화된 언어 시스템은 일반적으로 개인화성을 회상 문제로 다루지만, 실제로는 시스템이 약속을 지속할 때 많은 실패가 발생한다. 이 연구에서는 약속 범위 설정을 위한 Contract-Bounded Evidence Activation (CBEA)와 Lexicographic Commitment Validation (LCV) 기법을 제안한다. CBEA+LCV는 360 개의 테스트 케이스와 세 가지 생성 백엔드에서 실패율이 0.49-0.60로 유지되며, raw와 long-context baseline은 0.003-0.092의 실패율만큼 유지할 수 없다.

AI 모델 5월 19일

지식 그래프를 이용한 자기주도 지식 보강: 그래프 이론 기반 LLM 보강

지식 그래프를 이용한 자기주도 지식 보강 기술인 MetaKGEnrich를 소개합니다. 이 기술은 대규모 언어 모델(LLM) 응용 프로그램에 자기주도 지식 보강 기능을 제공합니다. MetaKGEnrich는 세 가지 주요 단계를 거칩니다: 지식 그래프 생성, 구멍을 찾기 위한 그래프 메트릭 탐색, 웹 증거를 검색 및 처리.

AI 모델 5월 19일

대규모 언어 모델의 선형 대수 산술 오류를 드러내는 법과학적 벤치마크: LinAlg-Bench

대규모 언어 모델의 선형 대수 산술 오류를 평가하기 위한 새로운 벤치마크를 소개합니다. 이 벤치마크는 3x3, 4x4, 5x5 행렬에 대한 10개의 대규모 언어 모델을 평가하고, 9개의 과제 유형과 660개의 SymPy-인증 문제를 포함합니다. 벤치마크는 6,600개의 모델 출력을 평가하고, 1,156개의 오류를 분류하여 LLM의 산술 오류가 무작위적이지 않고 구조적으로 제약된다는 것을 밝혀냈습니다.

LLM PC 5월 19일

자연 속 지능력의 지속 가능성: 지식 적응형 에지 전문가 에이전트를 통해 생태계 모니터링 민주화

자연 속 생물 다양성의 급격한 감소는 효과적인 모니터링의 긴급성을 강조한다. 그러나 수동 조사를 위한 수작업 조사는 자원에 대한 확장성 있는 대안을 제공한다. обыч AI는 환경의 변동성으로 인해 자연 속에서 성능을 발휘하는 데 어려움을 겪는다. 현재의 방법은 모델을 다시 훈련하기 위해 필드 데이터를 지속적으로 업로드하는 클라우드 자원에 의존한다. 그러나 이러한 접근 방식은 제한된 전력과 네트워크 연결로 인해 원격 배포에 적합하지 않다. 이러한 제약을 해결하기 위해 이 연구에서는 모델 적응에서 지식 적응으로 전환하는 것을 제안한다. 우리는 시각적 인지와 사유를 분리하는 아키텍처를 소개한다. 시각 인코더와 동적 지식베이스를 결합하여 시각 인코더와 동적 지식베이스를 결합한다. 우리는 암묵적으로 모델 매개변수에 전문 지식을 인코딩하는 대신 명시적인 지식베이스를 사용한다. 또한 지식의 지속성을 지원하여 구조화된 형식으로 전문가 인사이트를 보존한다. 생물학자와 원주민 공동체와의 교차 학문적 협력으로 이 작업은 윤리적인 AI 공동 개발을 진전시키고, 책임 있는 생태계 관리를 위한 문화적으로 교육된 생태계 관리를 지원한다.

AI 모델 5월 19일

TTE-Flash: Chain-of-Thought를 통해 멀티모달 표현을 가속화하는 '생각-그후-임베딩 토큰'

연구진은 Chain-of-Thought(CoT) 논리를 통해 Universal Multimodal Embedding(UME)의 성능을 크게 향상시켰다. 하지만 CoT를 생성하는 데 필요한 컴퓨팅 자원은 종종 부담이 된다. 연구진은 CoT를 생성하는 대신 latent think 토큰을 사용하여 CoT를 생성하는 것을 방지한다. 이 연구에서는 think 토큰과 임베딩 토큰을 추출하는 방법과 think 토큰과 임베딩 토큰을 학습하는 방법에 대한 두 가지 주요 아키텍처 디자인을 조사한다.

AI 모델 5월 19일

정책 기반, 순열 불변 자기부가 가치 있는 자원 생성

물리학 기반 시뮬레이션 대신 머신 러닝을 사용하는 재료 과학의 주요 과제 중 하나는 목표 특성과 관련된 후보 재료를 빠르게 식별하는 것입니다. 머신 러닝은 재료의 안정성과 다른 목표 특성에 따라 재료를 필터링하는 더 빠르고 저렴한 방법을 제공하여 비용이 많이 드는 합성 단계에 도달하는 후보 재료의 수를 줄입니다. 최근 대규모 언어 모델(LLM)들이 이 역할에 적용되었습니다. 그러나 이러한 모델들은 훈련 단계와 추론 단계 모두에서 매개 변수가 많고 계산 비용이 높아 대량 처리 작업에 적합하지 않습니

AI 모델 5월 19일

확장 가능한 불확실성 논리 reasoning in 지식 그래프

지식 그래프는 의미 데이터 통합에 중요합니다. 그러나 실제 세계 데이터를 모델링하는 것은 종종 본질적으로 불확실합니다. 지식 그래프 내에서 불확실성은 세 가지 DISTINCT 수준에서 나타납니다: 불확실한 속성 값, 확률적 triple 존재, 그리고 불완전한 스키마 지식. 그러나 현재 Semantic Web 표준은 이러한 불확실성에 대한 reasoning을 native하게 지원하지 않으며, 나"이브한 확장은 계산적으로 불가항력적입니다. 이 논문에서는 EACH 수준을 통해 tailored 기술을 개발하는 모듈러 프레임워크를 개발하는 것을 목표로 합니다: (1) 연속 속성에 대한 확률적 리터럴 정의 및 해당하는 쿼리 대수; (2) 불확실한 triple에 대한 SPARQL provenance를 트랙터블한 확률적 회로로 변환하는 컴파일레이션 기반 프레임워크; 그리고 (3) 통계적 스키마 reasoning을 위한 toplogy-aware 지오메트릭 임베딩. 중추 가설은 의미적 정밀성과 계산적 트랙터블성을 조화시키는 tailored reasoning 기법, 즉 대수적, 논리적, 그리고 지오메트릭 접근이 reconcile할 수 있다는 것입니다.

에이전트 5월 19일

속도와 효율성을 위한 웹 에이전트의 유추 실행

Skim은 웹 에이전트의 예측 가능한 구조를 이용하여 웹 사이트의 예측 가능한 패턴을 이용한 유추 실행 프레임워크입니다. Skim은 웹 에이전트의 비용이 과도한 컴포넌트의 적용에 의해 발생하는 것임을 발견하였으며, 사이트별로 한 번만 프로파일링하여 이러한 패턴을 캡처한 후 런타임에 각 쿼리를 템플릿과 매치하여 목적 URL을 합성하고 결과를 추출하는 방식으로 성능을 향상시킵니다.

에이전트 5월 19일

연구실 자동화의 새로운 지평: AI 에이전트로의 도약

연구실 자동화를 통해 과학 실험의 빠르기, 안전성, 정확성, 재현성을 높일 수 있다. 하지만 연구실 자동화를 위해 여러 장비와 로봇을 조정하는 것은 과학자들에게 코드 작성, 설정 파일 관리, 복잡한 소프트웨어 인프라 탐색과 같은 어려움을 собою 둔다. 이에 대한 해결책으로, 과학자들이 자연어를 통해 자동화된 실험 프로토콜을 생성하고 모니터링할 수 있는 AI 에이전트 아키텍처를 제시한다.

인기 태그