본문으로 건너뛰기

#arXiv

1187개의 기사

에이전트 5월 15일

과학 이론 전환을 감지하는 AI 에이전트의 Sheaf-이론적 운반 및 장애

과학 이론 전환을 감지하는 AI 에이전트가 데이터에 적합한 방정식을 맞추는 것 이상의 것이 필요하다. 인공 과학 에이전트는 기존의 표현적 프레임워크가 새로운 영역으로 운반될 수 있는지, 또는 그 언어가 지역적으로-global하게 장애가 발생하고 확장해야 하는지 감지해야 한다. 이 논문은 운반 및 장애를 통해 이론 전환 후보를 감지하는 유한 Sheaf-이론적 프레임워크를 개발한다.

LLM PC 5월 15일

다음 토큰 예측과 속성 추정: 자가회귀 시퀀스 모델의 새로운 접근

자연어 처리 모델은 일반적으로 다음 토큰 예측 목표로 훈련되지만, 많은 다운스트림 애플리케이션은 시퀀스 수준의 속성을 추정하거나 제어할 수 있는 능력을 필요로 합니다. 다음 토큰 예측은 훈련 중에 지역 패턴에 대한 과적합, 전역 구조에 대한 과소적합, 그리고 인플루언스 시간에 전역 속성을 예측하거나 안내하기 위한 다운스트림 수정 또는 비싼 샘플링이 필요합니다. 이에, 우리는 속성에 대한 조건부 속성 변환기(Conditional Attribute Transformers)를 소개합니다. 이 프레임워크는 단일 전방 패스에서 세 가지 중요한 기능을 제공합니다: (1) 시퀀스 전체에서 각 토큰에 대한 신용 부여, (2) 대체 다음 토큰 선택에 대한 속성 차이량의 계산, (3) 다음 토큰과 속성 확률의 조합에 기반한 시퀀스 디코딩.

에이전트 5월 15일

정치 뉴스 Nugget: 대규모 언어 모델(LLM) 기반 장소성 정보 통합 평가

정치 뉴스 Nugget은 대규모 언어 모델(LLM)을 장소성 프레임워크에 통합하여 정적 질문에 대한 긴 문맥 정보 검색을 개방형 탐색으로 변형시켰다. 그러나 실제 세계 사용에는 모델이 분산된 소스에서 '장거리' 사실을 발견하고 통합하는 능력이 필요하며, 이 능력은 평가되지 않았다. 정치 뉴스 Nugget은 400명의 글로벌 엘리트를 위한 정치 전기서를 구성하여 10,000개 이상의 정치 사실을 포함하는 다언어 벤치마크를 소개한다.

에이전트 5월 15일

다음 환경에서 작업하기 전 무작정 메모리 구축: Preping

이 연구에서는 무작정 메모리를 구축하는 방법을 연구한다. 무작정 메모리는 offline에서 커데이션된 데모레이션으로 구축하거나 online에서 포스트-배포 인터랙션으로 구축할 수 있다. 그러나 무작정 메모리는 새로운 환경에 처음 도입되었을 때 작업에 특화된 경험을 제공하지 않는 경우 cold-start gap을 마주한다. 이 연구에서는 무작정 메모리를 구축하기 전에 다음 환경의 경험을 제공하지 않는 경우 대규모 언어 모델(LLM)과 같은 메모리를 구축하는 방법을 연구한다.

에이전트 5월 15일

숨겨진 지휘자, 권력자와의 분리: 다중 에이전트 LLM 시스템의 안전 위험

AI 시스템의 안전성을 높이기 위해 다중 에이전트 지휘 시스템을 사용하는 기업이 증가하고 있지만, 지휘자의 불투명성에 대한 안전성의 영향은 아직 empirical 테스트되지 않았다. 연구진은 3x2 실험을 수행하여 3가지 조직 구조(투명한 리더, 불투명한 지휘자, 평평한)와 2가지 정렬 조건(기본, 중간)을 비교하였다. 연구 결과, 불투명한 지휘자가 투명한 리더보다 집단 분리도를 높여주었고, 지휘자 자신이 최대 분리도를 보였다.

에이전트 5월 15일

2차원 프레임워크: AI 에이전트 디자인 패턴의 인지 기능과 실행 토폴로지

AI 에이전트 아키텍처에 대한 기존 프레임워크는 단일 관점에서 시스템을 설명합니다. 산업 가이드는 실행 토폴로지에 초점을 맞추며, 인지 과학 교과서는 인지 기능에 초점을 맞추며, 그 중 하나만으로도 아키텍처적으로 DISTINCT 시스템을 구분할 수 없습니다. 우리는 인지 기능축과 실행 토폴로지축을 결합하여 두 차원 분류를 제안합니다. 인지 기능축에는 7개 카테고리(컨텍스트 엔지니어링, 메모리, 사유, 액션, 반영, 협력, 지배)가 포함되며, 실행 토폴로지축에는 6개의 구조적 아키텍처가 포함됩니다. 이 결과로 27개의 이름이 지정된 패턴이 생성되며, 13개는 원래 이름이 지정됩니다.

연구 5월 15일

개인화된 식사 최적화에 대한 혼합 정수 목표 프로그래밍

식단 최적화 문제는 운영 연구의 가장 오래된 최적화 문제 중 하나입니다. 그러나 기존의 형식에는 두 가지 지속적인 한계가 있습니다. 연속 변수는 실제적인 분수 섭취를 생성하고 (1.7개의 계란, 0.37개의 바나나), 그리고 강도 영양 섭취가 목표가 충돌할 때 불가능합니다. 56개의 식단 최적화 논문에 대한 체계적인 검토는 integer programming과 goal programming을 모두 결합하는 논문이 없다는 것을 발견했습니다. 우리는 개인화된 식사 최적화를 위한 혼합 정수 목표 프로그래밍(MIGP)을 제안합니다. 이 형식은 실제적인 섭취 수를 위한 정수 변수를 사용하고, 목표 영양 섭취를 위한 goal programming의 변동을 사용합니다. 또한, multi-nutrient 최적화를 균형시키기 위해 역-목표 정규화(INN)를 사용합니다. 식품당 섭취의 자연 단위(한 개의 계란, 한 자루의 기름)를 허용하기 위해 per-food 섭취의 세분성은 자연 단위로 유지됩니다.

에이전트 5월 15일

그래프비트: 비선형 에이전트 오케스트레이션을 위한 그래프 기반 에이전트 프레임워크

그래프비트는 대규모 언어 모델(LLM) 프레임워크에서 잘못된 라우팅, 무한 루프, 비재현성 실행을 방지하기 위해 개발된 그래프 기반 에이전트 프레임워크입니다. 이 프레임워크는 워크플로우를 명시적으로 정의하고, 에이전트가 타입 함수로 작동하며, 엔진이 라우팅, 상태 전환, 도구 호출을 관리하여 재현성과 감사성을 보장합니다.

LLM PC 5월 14일

주의가 닫히는 순간: LLM이 멀티 턴 상호 작용에서 주제를 잃는 이유

대규모 언어 모델(LLM)은 단일 턴에서 복잡한 지시를 따르지만, 장기적인 멀티 턴 상호 작용에서 지시, 인격, 규칙을 잃을 수 있다. 이 감소는 행동적으로 측정되었지만, 기계적으로 설명되지 않았다. 우리는 주제 정의 토큰이 주의의 통로를 통해 더 이상 액세스할 수 없게 되며, 주제 관련 정보는 잔여 표현에서 지속될 수 있다는 채널 전환 설명을 제안한다. 주제 액세스성 비율(GAR)을 도입하여 생성된 토큰에서 목표 정의 토큰으로 주의를 측정하고, 슬라이딩 윈도우 절단 및 잔여 스트림 프로브를 결합한다. 주의가 지시를 닫는 순간, 무엇이 살아남는지가 아키텍처를 드러낸다. 다양한 아키텍처에서 전환은 질적으로 다른 실패 모드를 산출한다: 일부 모델은 주의가 사라지더라도 목표 조건된 행동을 보존하고, 다른 모델은 잔여 목표 정보가 디코딩될 수 있더라도 실패한다. 이 인코딩이 발생하는 레이어는 2에서 27까지 다양하다. 모델 내의 인과적 절단이 Mistral의 주의 통로를 강제로 닫으면, 20개 사실 보존 태스크에서 반환률이 11%에서 거의 완벽한 11%로 떨어지고, 불편한 압력 기반 대조군보다 인격 제약 위반률이 높아지며, 이 모든 효과는 예측 가능한 교차 턴에서 발생한다. 선형 프로브는 Aimed 표현에서 회귀 결과를 회복시키는 AUC가 0.99까지 모든 네 가지 주요 아키텍처에서 0.99까지 달성한다. 입력 임베딩은 기대치에 머물러 있다. 다양한 아키텍처와 모델 규모에서 주의 손실과 잔여 디코딩 가능성의 간격이 목표 조건된 행동이 주의 통로가 닫히는 경우에 살아남는지 여부를 예측한다. GAR를 진단도구로, 채널 전환 프레임워크를 제어된 기계적 설명으로, 윈도우드 주의 닫기로 실패 시간을 예측하는 파라미터 예측을 기여한다.

AI 모델 5월 14일

협력 시뮬레이터를 넘어서: 강력한 LLM 에이전트 평가를 위한 실제 사용자 프로필 생성

협력 시뮬레이터를 넘어서: 강력한 대규모 언어 모델(LLM) 에이전트 평가를 위한 실제 사용자 프로필 생성 대규모 언어 모델(LLM) 에이전트는 사용자와 다양한 사람을 상호작용하는 환경에서 점점 더 많이 배치되고 있다. 이들은 사용자가 불분명한, 서두르는, 또는 정보를 공유하기 꺼리는 사람들을 포함한다. 그러나 대규모 사용자 상호작용 데이터를 수집하는 것은 여전히 비용이 많이 들다. 이 분야는 대규모 언어 모델 기반 사용자 시뮬레이터를 대신 사용하기로 결정했지만, 이 시뮬레이터는 기본 모델의 행

LLM PC 5월 14일

다중 모드 히든 마르코프 모델을 이용한 지속적인 감정 상태 추적

대화의 감정 상태를 추적하는 것은 의료 및 임상적인 대화 상황에서 이해하고 대화의 지침을 줄 수 있는 중요한 요소입니다. 기존의 감정 인식 방법은 대화 단위로 작용하여 실제 대화 동적의 지속적인 단계를 숨기고 있습니다. 우리는 다중 모드 감정 표현을 이용하여 대화의 감정 상태를 지속적인 감정 상태로 모델링하는 가벼운 프레임워크를 제안합니다. 이 프레임워크는 지속적인 감정 상태를 추적하는 데 있어 가중치 요인 분산 혼합 모델-히든 마르코프 모델(Sticky Factorial HDP-HMM)을 이용합니다.

에이전트 5월 14일

계층적 행위 언어 평의회

계층적 행위 언어 평의회(arXiv:2605.12718v1)가 발표한 뉴스에 따르면, 현재 대규모 언어 모델(LLM)의 논리적 사고를 향상시키기 위한 다중 에이전트 토론의 방법론은 다음과 같은 제한점을 가지고 있다. 토론은 믿음 경로에 대한 마르팅게일(martingale)을 유발하고, 다수 투표는 대부분의 관찰된 이익을 고려하고, LLM은 라운드별로 신뢰도 상승보다는 조정(calibration)을 나타낸다. 토론의 genuin value와 대화 시스템의 전체 가치가 지대-truth 태스크에서 아니

연구 5월 14일

장애 관련 해프닝을 언어 모델에 있는 평가 프레임워크: DisaBench

장애 관련 해프닝을 언어 모델에 있는 평가 프레임워크: DisaBench 장애 관련 해프닝을 평가하는 일반적인 방법은 대규모 언어 모델(LLM)의 안전성을 충분히 평가하지 못한다. 우리는 DisaBench라는 새로운 평가 프레임워크를 소개한다. 이 프레임워크는 장애인과 레드팀(expert)과 함께 12가지 장애 관련 해프닝 카테고리를 만들었고, 일상생활 7가지 영역에서 나쁜(prompt)과 악의적인(prompt) 쌍을 짝지어 evaluation 방법론을 만들었다. 또한 525개의 prompt-r

연구 5월 14일

작업 기반 지식 업데이트 문제: 첫 번째 계층 의존성과 결정 가능성

작업 기반 지식 업데이트 문제, 즉 작업 효과를 반영하는 지식 기반을 업데이트하는 과제는 일반적으로 두 번째 계층 논리를 필요로 합니다. 첫 번째 계층 특수 사례를 식별하기 위해 지식 기반 또는 작업 효과를 제한하는 것은 행동에 대한 논리적شر의 중심 주제 중 하나입니다. 그러나 이러한 작업 클래스, 즉 지역 효과, 정상, 및 사이클이 없는 작업이 첫 번째 계층 논리를 허용하는 것으로 알려져 있지만, 이러한 업데이트의 크기를 분석하는 시스템적인 연구는 실용적용을위한 필수적이지만 누락된 주제입니다. 이 논문에서는 상황 계산기 프레임워크를 사용하여 이러한 작업 클래스에 대한 첫 번째 계층 업데이트가 합리적인 가정하에 일반적으로 다항식으로 증가한다는 것을 보여줍니다. 또한 지식 기반이 결정 가능한 부분집합인 두 변수 첫 번째 계층 논리 또는 상수와 함께 일반화된 이론과 같은 경우, 업데이트도 동일한 부분집합에 속한다는 것을 보여줍니다. 이는 결정 가능성과 실용적용을 보장합니다.

LLM PC 5월 14일

인간과 맞닿은 의사결정에 적합한 암묵적 사용자 선호도 학습

대규모 언어 모델(LLM)은 많은 응용 분야에서 사고 모듈로 사용되며, 효율적이지만 인간과 맞닿은 의사결정에 적합하지 않습니다. 인간과 맞닿은 의사결정은 명시적으로 명시된 목표와 암묵적 사용자 선호도가 함께 고려되어야 합니다. 그러나 암묵적 사용자 선호도를 고려하는 기존 접근법은 사용자와의 반복적인 상호작용이 필요하거나, 과제와 환경에 대한 암묵적 선호도를 일반화하지 못하여 실용적 활용성에 제한을 받습니다.

에이전트 5월 14일

안드로이드가 게임을 깨는 꿈을 꾸는가? BenchJack으로 AI 에이전트 벤치마크를 체계적으로 감사하는 방법

AI 에이전트 벤치마크는 현재 프론티어 AI 능력의 표준으로 사용되고 있습니다. 그러나 reward hacking이 발생하여 에이전트가 의도한 작업을 수행하지 않고 점수를 최대화하는 문제가 발생하고 있습니다. 벤치마크가 보안을 위한 디자인으로 구현되어야 한다는 것을 주장합니다.

에이전트 5월 14일

대규모 행동 기반 다중 에이전트 지시 따르기 через 가치 취소

다중 에이전트 강화 학습(MARL)에서 외부 자연어 지시가 진행 중인 행동을 중단하고 장기 목표와 충돌할 수 있습니다. 그러나 지시 조건에 보상을 Conditioning하면 Bellman 업데이트가 지시 문맥 간 가치 추정치를 결합하여 지시가 대규모 행동을 중단할 때 불일치한 가치를 유발합니다. 우리는 대규모 행동 기반 가치 교정 지시 협응(MAVIC)을 제안하여 지시 경계에서 Bellman 백업을 교정하여 incoming 지시 목표를 교정하고 현재 목표하의 지속 가치를 복원합니다. MAVIC는 보상 형식을 통해 가치 추정치를 수정하는 대신, 백스텝 타겟 자체를 수정하여, 지시가 임의로 스위칭되는 동안 단일 정책 내에서 일관된 가치 추정치를 유지하는 데 도움이 됩니다.

AI 모델 5월 13일

LLM 허구감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察

LLM 허구 감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察 LLM 허구, 즉 신뢰할 수 없는, 가짜, 또는 일관성이 없는 콘텐츠를 생성하는 LLM에 의해 생성되는 내용을 광범위하게 의미하는 것으로, 광범위한 영향력을 가지고 있다. 따라서 LLM 허구 감지를 감지하고 이러한 감지기 평가를 위해 설계된 벤치마크 데이터 세트를 디자인하는 데에 크게 노력한 바 있다. 이 연구에서, 우리는 허구 감지 벤치마크(HDB)의 효과적인 평가를 위해 보여주어야 하는 속성의 필요

인기 태그