본문으로 건너뛰기

검색

전체 기사

에이전트 5월 20일

자동화 도구 사용에서의 의사 결정권 확장: 신뢰 도출의 공식화

자동화 도구 사용에서의 의사 결정권 확장: 신뢰 도출의 공식화 자동화 도구 사용에서 의사 결정권 확장 공식화, 즉 자동화된 에이전트가 제안하는 행동이 자율적으로 실행되거나 인간 승인 필요 여부를 결정하는 것을 인간의 위험 동의 함수를 관찰하는 프로빗 likelihood에 의한 가우시안 프로세스 포스트리어를 유지하는 정책 게이트웨이로 preference-learning 문제로 간주한다. 자동화 도구 사용에서 의사 결정권 확장 공식화는 구조적으로 Preferential Bayesian Optim

에이전트 5월 20일

워크플로우 학습을 위한 인터페이스 제약 하의 확실히 수렴하는 방법 학습

워크플로우 학습을 위한 인터페이스 제약 하의 확실히 수렴하는 방법 학습 워크플로우 학습을 위한 인터페이스 제약 하에서, 각 에이전트는 공유된 artifact와 자신의 개인 상태에 대한 지역 함수만 관찰하고, 중앙 집중식 학습자가 공동 경로에 접근하지 않는 다중 에이전트 대규모 언어 모델(LLM) 파이프라인의 운영 영역을 연구합니다. 이 영역을 인터페이스 제약 하의 반semi-Markov 결정 과정(IC-SMDP)으로 구체화하고, 에이전트 간의 교차 조정은 매 이관마다 정확히 하나의 스칼라로 디자

에이전트 5월 20일

POLAR-Bench: 프라이버시-유틸리티 트레이드오프를 위한 LLM 에이전트의 진단 벤치마크

POLAR-Bench: 프라이버시-유틸리티 트레이드오프를 위한 대규모 언어 모델(LLM) 에이전트의 진단 벤치마크 대규모 언어 모델(LLM) 에이전트는 점점 더 사용자의 개인 정보에 접근하고 사용자의 대리인으로서 세 번째 당사자 시스템과 상호 작용할 때 사용자의 의도에 따라 행동한다. 사용자는 공유할 수 있는 것과 공유하지 말아야 하는 것을 정의하고 에이전트는 세 번째 당사자 시스템이 적대적으로 행동하는 경우에도 그 의도를 강력하게 따르도록 해야 한다. POLAR-Bench(정책에 의한 적대

에이전트 5월 20일

긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크: DecisionBench

DecisionBench는 긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크이다. DecisionBench는 작업 집합(GAIA, tau-bench, BFCL multi-turn), 동료 모델 풀(11 모델, 7 벤더 가족), 위임 인터페이스(call_model와 읽기 프로파일 채널의 옵션), 결정론적 스킬-ANNOTATION 레이어, 품질, 비용, 지연 시간, 위임률, 라우팅 신뢰도-at-k, 벤더 자체 선호도, 그리고 카운터팩토럴 위임 천장으로 구성된 다중 축 메트릭 스위트를 포함

AI 모델 5월 20일

시스템 프롬프트 최적화에 대한 연구: 동적 표현을 통한 베이즈 최적화

시스템 프롬프트는 현대 AI 시스템의 중심 제어 메커니즘으로, 대화, 작업 및 사용자 인구를 통한 행동을 형성합니다. 그러나 피드백이 예시별 레이블, 오류 또는 비판이 아닌 집계 메트릭으로만 제공되는 경우 프롬프트를 조정하는 것이 어렵습니다. 본 연구에서는 집계 피드백 설정을 단순화된 블랙박스 최적화로 연구합니다. 이 연구에서는 ReElicit, 베이즈 최적화 프레임워크를 소개합니다. ReElicit는 대규모 언어 모델(LLM)을 사용하여 compact하고 해석 가능한 특성 공간을 유도하고 프롬프트를 이 특성 공간으로 매핑합니다. 확률적 가우시안 프로세스 서브레이트를 사용하여 수집된 프롬프트 점수를 기반으로 acquisition 함수는 목표 특성 벡터를 선택하고 LLM은 이를 구현하고 최적화하여 배포 가능한 시스템 프롬프트로 만듭니다. 새로운 평가가 도착할 때마다 특성 공간을 재엘리시트하여 관찰된 프롬프트-점수 역사에 따라 표현을 적응시키는 것이 가능합니다.

AI 모델 5월 20일

인터페어런스-어웨어 멀티태스크 언러닝

인터페어런스-어웨어 멀티태스크 언러닝은 기존의 단일 태스크 설정에서만을 위한 언러닝 방법을 개선하여, 다중 태스크 환경에서 모델의 학습 데이터를 제거하는 방법을 제안합니다. 이 방법은 전체 태스크 언러닝과 부분 태스크 언러닝 두 가지 설정을 제공하며, 태스크 간의 간섭을 줄이고 모델의 성능을 유지하는 것을 목표로 합니다.

에이전트 5월 20일

신뢰할 수 있는 에이전트 네트워크: 에이전트 네트워크에 신뢰를 구축해야, 부착할 수는 없다

대규모 언어 모델(Large Language Model, LLM) 기반의 자율 에이전트가 복잡한 추론과 실행을 가능하게 한 결과, 에이전트 간 협력 네트워크가 등장하고 있다. 이러한 네트워크는 단일 에이전트가 전체 작업을 수행하는 것보다 작업 성능이 좋아 보이지만, 현재 에이전트 정렬 기술로는 존재하는 시스템 취약성, 즉 적대적 합성, 의미 불일치, 연쇄적 운영 실패를 해결할 수 없다. 이 비전 논문에서는 에이전트 간 협력 네트워크의 신뢰성을 보장하기 위해 기존 프로토콜에 retrofitting하는 것만으로는 충분하지 않으며, 네트워크 협력 프레임워크의 시작부터 신뢰성을 설계해야 한다고 주장한다.

LLM PC 5월 20일

KAN-MLP-Mixer: 시계계량기 기반 인간 활동 인식 모델을 개선하는 Kolmogorov-Arnold Networks (KANs) 조사

KANs는 깨끗하고 저차원 데이터에서 복잡한 함수를 학습하는 데 뛰어난 능력을 보이지만, 노이즈와 불완전한 실세계 데이터셋에서 성능을 유지하는 데 어려움을 겪고 있습니다. 반면, 전통적인 다층 퍼셉트론 (MLPs)은 노이즈에 대한 내구성을 보장하고 계산 효율성을 제공합니다. KANs를 HAR 모델의 모든 MLP 구성 요소로 대체하면 정확도와 계산 효율성이 저하되는 문제를 해결하기 위해, 우리는 깊은 HAR 네트워크 내에서 KAN 모듈의 다양한 배치를 시스템적으로 탐구하고, KAN-MLP 하이브리드 아키텍처를 제안합니다. 이 아키텍처는 KAN 기반 입력 임베딩 레이어를 사용하고, 중간 특성 혼합을 위해 MLP 레이어를 유지하고, 최종 활동 분류를 위해 특수화된 LarctanKAN 모듈을 소개합니다. 8개의 공개 HAR 데이터셋에서, 하이브리드 KAN-MLP 모델은 순수 MLP 모델에 비해 평균 macro F1 점수 상대 향상률 5.33%를 달성하고, 독립된 KAN 및 MLP 기준선보다显著히 성능을 개선합니다. 또한, 이 하이브리드 전략을 다른 최신 HAR 아키텍처에 통합하면, 그들의 성능을 지속적으로 향상시킵니다.

에이전트 5월 20일

대화형 자연어 질문을 SQL로 변환하는 일반 용도 에이전트: AgentNLQ

대화형 자연어를 SQL로 변환하는 문제는 연구자와 기업에게 중요한 문제로, 관계형 데이터베이스가 광범위한 실용적인 문제에 중요한 역할을 하기 때문이다. 대규모 언어 모델(LLM)의 능력 향상에도 불구하고, 대화형 자연어를 SQL로 변환하는 문제는 인간 전문가 SQL 작가와의 정확도 면에서 여전히 열린 문제로, 추가적인 개선이 필요하다. 이 연구에서는 대화형 자연어를 SQL로 변환하는 새로운 다중 에이전트 방법을 제시한다. 이 방법은 78.1%의 의미적 정확도를 달성하는 BIg Bench for LaRge-scale Database (BIRD) 벤치마크에 대해 평가되었다. 이 연구의 주요 기여는 다음과 같다: (a) 다중 에이전트 솔루션에서 최적화된 새로운 오케스트레이터를 설계하여 LLM을 사용하여 계획, 오케스트레이션, 반영, 자체 교정하여 정확한 SQL 쿼리를 생성한다. (b) 고급 스키마 enrichment 방법을 개발하여 정확성을 향상시키기 위해 계층 구조 메타데이터를 생성한다. (c) BIRD-SQL 벤치마크에서 다중 도메인과 데이터셋에 대한 정확성과 일반화성을 평가하여 정확성과 일반화성을 보여준다.

AI 모델 5월 20일

학습-밴드-스트레스 하에서 안정성과 효율성을 위한 한계自治 학습 제어 관할

대규모 언어 모델(LLM) 학습이 점점 더 불안정해지고, 낮은 성능과 낭비된 컴퓨팅이 발생하고 있습니다. Learn-by-Wire Guard(LBW-Guard)는 AdamW 위에 작동하는 한계自治 학습 제어 관할 계층을 소개합니다. LBW-Guard는 최적화 업데이트 규칙을 대체하는 대신, 학습 전송을 관찰하고 불안정성에 민감한 영역을 해석하여 최적화 실행에 한계 제어를 적용합니다. LBW-Guard는 WikiText-103에서 Qwen2.5-centered stress-and-robustness suite를 사용하여 Qwen2.5-7B를 empirical anchor로 평가합니다. Qwen2.5-3B와 Qwen2.5-14B와의 모델 크기 비교, 학습률 스트레스 테스트, 기울기 클리핑 베이스라인, TinyLlama-1B의 전체 매개변수 절대 안정성 검사도 수행합니다. 7B 참조 설정에서 LBW-Guard는 최종 혼동도 13.21에서 10.74로 개선되어 18.7% 향상되며, 종단 간 시간이 392.54s에서 357.02s로 1.10배 가속됩니다. 더 강한 학습률 스트레스에서 AdamW는 LR=3e-3에서 1885.24 최종 혼동도와 LR=1e-3에서 659.76로 감소하지만, LBW-Guard는 11.57와 10.33으로 유지됩니다. 기울기 클리핑 베이스라인은 이 효과를 재현하지 못합니다. 이러한 결과는 안정성에 민감한 LLM 학습이 최적화자 위에 관할 평면을 가지는 데 이점이 있다는 scoped 시스템 결론을 지지합니다. LBW-Guard는 한계 런타임 제어가 스트레스 하에서 효율적인 컴퓨팅을 유지하면서 최적화자 대체와 지역 기울기 억제와 구별되는 증거를 제공합니다.

AI 모델 5월 20일

개인건강기록을 활용한 맞춤형 건강 AI의 유효성 평가

개인건강기록을 활용한 맞춤형 건강 AI의 유효성 평가 개인 관리형 개인건강기록(Patient-managed Personal Health Records, PHR) 은 환자가 자신의 건강을 더 잘 이해할 수 있도록 권한을 부여하지만, 기록에 있는 정보는 복잡하여 통찰력을 방해할 수 있다. 이 연구에서, 우리는 환자 질문에 대한 도움이 되는 답변을 제공할 수 있는 대규모 언어 모델(LLM, Gemini 3.0 Flash)의 잠재력을 평가하기 위해 PHR에서 클리닉 데이터를 컨텍스트로 제공할 때 평가했