본문으로 건너뛰기

#arXiv

1187개의 기사

AI 모델 5월 13일

데이터 가치 최적화: 데이터 특성화 활용을 통한 저데이터 환경에서의 데이터 절단

저데이터 환경에서 데이터 절단을 위한 데이터 특성화 활용을 제안하는 연구입니다. 연구에서는 기존의 데이터 주성분 분석 방법을 개선하고, 데이터 특성화에 기반한 데이터 절단 기법을 제안합니다. 제안된 기법은 데이터 특성화에 기반하여 데이터 절단을 수행하며, 데이터 절단 후 모델의 성능을 향상시키는 데 도움이 됩니다.

LLM PC 5월 13일

다중 모드 모델에 맞는 선택을 할 수 있을까? LatentRouter

대규모 다중 모드 언어 모델(LLM)의.espresso heterogeneous한 강점이 OCR, 차트 이해, 공간적 사고, 시각적 질문에 대한 답변, 비용, 지연 시간과 같은 다양한 태스크에 걸쳐 있습니다. 이에 따라 효과적인 다중 모드 모델 라우팅은 단순히 쿼리 난이도를 추정하는 것 이상의 작업을 필요로 합니다. 라우터는 현재 이미지-질문 입력의 다중 모드 요구 사항을 각 후보 모델의 능력과 매칭해야 합니다. LatentRouter는 대규모 다중 모드 언어 모델(LLM)의 라우팅을 카운터페이탈 다중 모드 유틸리티 예측으로 형식화하는 라우터를 제안합니다.

AI 모델 5월 13일

템플릿-온톨로지: 제조 AI 유효성 검증을 위한 구성 가능한 시뮬레이션 데이터 인프라

제조 환경에서 배포된 대규모 언어 모델(LLM)-기반 AI 에이전트는 유효성 검증을 위해 채워진, 스키마가 정확한 데이터가 필요하지만, 생산 MES 데이터는 사유적, 개인정보에 부합되지 않으며, 벤더_SPECIFIC 합니다. 이 논문은 템플릿-온톨로지 원칙을 소개합니다: 하나의 파이썬 구성 모듈(700-770 라인, 45 유효한 내보내기)이 동시에 시간 단위의 제조 시뮬레이터의 스펙으로 사용되고, AI 분석 도구의 런타임 도메인 스키마로 사용되어, 통합보다는 구성으로 인해 일치가 보장됩니다.

AI 모델 5월 13일

과학에서 언어 모델의 창의성을 개방하는 비유적 사고

과학에서 언어 모델의 창의성을 개방하는 비유적 사고 자율 과학은 특히 생의학 분야와 같은 복잡한 분야에서 과학적 발견을 증대시키는 것을 약속한다. 그러나 이것은 AI 시스템이 열린 문제에 대해 일관되게 새로운 및 다양한 솔루션을 생성할 수 있어야 한다. 우리는 열린 문제 해결의 경우 언어 모델(LM)을 평가하고 그들의 모드 충돌 모드에 대한 다양성으로 생성되는 다양성의 경향을 측정한다. 모드 충돌을 완화하기 위해 우리는 솔루션 생성의 새로운 접근 방식으로 비유적 사고(AR)를 도입한다. AR는

에이전트 5월 13일

시맨틱 트레이닝 격차: 제조 AI 에이전트 시스템을 위한 온톨로지 기반 도구 아키텍처

대규모 언어 모델(LLM)-기반 AI 에이전트가 제조 환경에서 분석, 품질 관리 및 의사결정 지원을 위해 점점 더 많이 배치되고 있습니다. 이 에이전트는 도메인 용어에 대한 통계적 유창성을 보여주지만, 특정 생산 맥락에서 장비 식별자, 프로세스 매개변수, 실패 코드 및 규제 제약과 관련된 관계적 구조인 운영 시맨틱스에 대한 기반 이해를 가지고 있지 않습니다. 이 문서는 시맨틱 트레이닝 격차를 식별하고 공식화합니다. 이 격차는 AI 시스템이 훈련을 통해 도메인 용어를 획득하는 방식과 제조 운영이 의미를 정의하는 온톨로지적 관계에 대한 구조적 불일치입니다.

AI 모델 5월 13일

LLMOps를 재평가하는 악성거래 및 AML: 규제등급 LLM 서비스 스택 구축

악성거래 및 Money Laundering(AML) 검출은 대규모 언어 모델(LLM)의 고가치 도메인 중 하나입니다. 그러나 이들은 일반적인 채팅 작업로드와 달리 서비스 요구 사항이 크게 다릅니다. 규제 요청은 종종 전위-heavy, 스키마-제한적이고 증거-부하되는 특성을 나타냅니다. 이러한 속성은 전위 재사용, KV 캐시 효율성, 런타임 튜닝, 모델 오케스트레이션 및 출력 검증이 첫 번째 시스템 문제가 됩니다. 이 논문은 악성거래 및 AML 작업로드를 위한 작업-감각 LLMOps 스택을 소개합니다. 이 스택은 Meta Llama 및 Alibaba Qwen과 같은 자체 호스트 오픈 가중 모델을 사용합니다. 작업-감각 LLMOps 스택은 vLLM-style 런타임 튜닝, PagedAttention, 자동 전위 캐싱, 다중 어댑터 서비스, 어댑터 및 전위 길이-감각 배치, 슬립/와이클라이프 관리, 예측적 디코딩 및 옵션 프리필/디코딩 분리화를 포함합니다.

에이전트 5월 13일

PIVOT: 계획과 실행을 연결하는 LLM 에이전트에서 경로 개선 방식

PIVOT: 계획과 실행을 연결하는 대규모 언어 모델(LLM) 에이전트에서 경로 개선 방식 대규모 언어 모델(LLM)-기반 에이전트는 종종 실행 시 비현실적인 행동, 제약 위반, 확장된 시간대에 누적된 오류로 인해 계획이 실패하는 것처럼 보이는 일관된 계획을 생성한다. PIVOT(Plan-Inspect-eVOlve Trajectories)는 계획-실행 불일치 문제를 해결하기 위해 환경 상호 작용을 통해 반복적으로 미세 тепло 작용하는 트래픽을 최적화하는 개체로 다루는 자가 지도 학습 프레임

AI 모델 5월 13일

숫자를 보지 마세요: 시각적 앵커링 편향과 VLM의 레이어별 표현

대규모 언어 모델(VLM)의 품질 판단에 영향을 미치는 시각적 앵커링 편향이 발견되었습니다. 이 편향은 6개의 대규모 언어 모델에서 5개의 아키텍처 가족을 통틀어 통계적으로 유의미한 결과를 나타냈습니다. 또한, 레이어별 프로빙 결과, 앵커 분류가饱和하는 레이어(L12-L34)는 품질 예측에 적합하지 않으며, 최적의 레이어는 더 깊은 레이어(R^2 = 0.69-0.91)입니다.

AI 모델 5월 13일

OPD의 많은 얼굴: 장애물, 기계, 그리고 해결책

온-폴리시 디스틸레이션(OPD)과 온-폴리시 셀프 디스틸레이션(OPSD)은 대규모 언어 모델(LLM)에서 promise하는 포스트-트레이닝 방법으로, 모델이 자신의 정책에서 샘플링한 경로에서 밀집한 토큰 수준의 감독을 제공합니다. 그러나 기존의 결과는 혼합된 상태로 남아 있습니다: OP(S)D는 시스템 프롬프트와 지식 내부화에 promise를 보여주었지만, 최근 연구에서는 불안정성과 악화가 보고되었습니다. 이 연구에서는 OPD와 OPSD가 언제 작동하고, 언제 실패하며, 왜 실패하는지에 대한 종합적인 실험적 연구를 제시합니다.

AI 모델 5월 13일

OLIVIA: 배포 시점의 결정 과정에 대한 행동 적응을 위한 온라인 학습

대규모 언어 모델(LLM) 에이전트는 논리적 추론, 행동 선택, 관찰을 번갈아가며 시퀀셜 결정 과제를 해결합니다. 배포 설정에서 에이전트가 반복적으로 관련된 다단계 과제를 처리할 때, 작은 행동 선택 오류가 시간 낭비, 지연, 신뢰도 감소로 누적될 수 있습니다. existing inference-time adaptation methods for LLM agents mainly rely on prompting or retrieval, which influence behavior indirectly through context manipulation.

AI 모델 5월 13일

오프라인에서 온라인으로의 강화 학습을 위한 RankQ: 자가 감독된 액션 랭킹

오프라인에서 온라인으로의 강화 학습은 샘플 효율성을 향상시키기 위해 미리 수집된 데이터 세트를 온라인 상호 작용 전에 사용합니다. 그러나 대규모 상태-액션 공간에서 데이터 세트 커버리지가 제한된 경우 정확한 비평가를 학습하는 것이 주요 도전 중 하나입니다. RankQ는 시간 차이 학습을 위한 자가 감독된 다항식 랭킹 손실을 추가하여 구조화된 액션 순서를 강제하는 오프라인에서 온라인으로의 Q 학습 목표를 제안합니다. RankQ는 액션 기울기를 더 높은 품질의 행동들로 향유도록 Q 함수를 형성하기 위해 상대적인 액션 선호도를 학습합니다.

에이전트 5월 13일

코에볼루션 챔버: TEST-TIME 멀티 에이전트 시스템의 개인, 팀, 인구 규모에서의 동시 진화

멀티 에이전트 테스트 시간 진화는 단일 에이전트 진화의 N번 반복이 아니다. 단일 에이전트 학습자는 자신의 컨텍스트와 메모리만 진화할 수 있다. 멀티 에이전트 시스템은 누가 협력하고, 어떻게 협력하고, 인구에 걸쳐 지식이 흐르는지까지 진화한다. 이러한 구성 요소는 단일 에이전트에 해당하는 것이 없고, 협력의 가치가 있는 수평적 지식 전달을 제거하는 테스트 시간 메서드의 한계를 극복한다. 이 연구에서는 테스트 시간 진화의 세 가지 수준을 보유한 TRAINING-FREE 프레임워크인 EVOCHAMBER를 제시한다. 이는 CODREAM(Collaborative Dreaming)이라는 POST-TASK 프로토콜을 통해 팀이 실패하거나 의견이 달라질 때, 에이전트들이 협력하여 반영하고, 통찰력을 경쟁적으로 강한 에이전트에게 전달한다. 이는 협력의 가치를 보존하는 동시에 지식의 미흡한 부분을 채운다.

AI 모델 5월 13일

동적 쇼핑몰 추천을 위한 계층적 생성 모델

대규모 온라인 상점에서 개인화된 storefront를 구축하는 데 사용되는 현재의 방법론은 rigidity와 고정된 테마, 제품 검색, 콘텐츠 순위를 결정하는 개별 구성 요소로 구성되어 있습니다. 이 방법론은 동적 목표 및 판매 목표를 지원하는 데 적합하지 않습니다. 이를 해결하기 위해 우리는 계층적 판매 프레임워크를 제시하고, storefront 구축을 두 가지 생성 태스크로 분할합니다: (i) 테마 생성 및 (ii) constrained keyword generation per placement으로 제품 검색을 위해 사용됩니다. Teacher-student fine-tuning은 이 프레임워크의 생산성 지연 및 비용 제약을 보완하기 위해 사용됩니다. Fine-tuned model ablations은 closed-weight LLM 성능에 접근합니다. 또한 우리는 AI-드라이브 콘텐츠 평가 및 품질 필터링 프레임워크를 제공하여 동적 콘텐츠의 안전하고 자동화된 배포를 가능하게합니다. 생성 출력은 전통적인 랭킹 모델과融合되어 하이브리드 인프라를 보존합니다. 온라인 실험에서 이 프레임워크는 강력한 기준선보다 페이지 뷰당 카트 추가 수에 +2.7%의.lift를 제공합니다.

에이전트 5월 12일

건강관리 AI를 위한 성능 측정: 생성적, 다모드, 그리고 주체적 AI를 위한 벤치마크

건강관리 AI를 위한 성능 측정은 복잡한 실세계 워크플로우에서 신뢰성, 안전성, 및 임상적 중요성을 측정하는 체계적인 방법이 부족하다. 대부분의 벤치마크는 모델이 무엇을 알고 있는지 테스트하지만, 실세계 임상 작업의 전체 복잡성을 고려한 신뢰성과 실패를 테스트하는 벤치마크는 부족하다.

AI 모델 5월 12일

鏡中的공격자: 안정된 이중 역할 자극을 통해 안전성을 깨는 방법

AI 안전성을 향상시키기 위한 자극된 팀(self-play) 접근법에서, 동일한 모델의 다양한 인스턴스가 공격자와 방어자 역할을 하며, 0-1 게임에서 공격자가 방어자를 탈옥시키려고 시도하는 경우, 자극된 팀이 Nash 평형에 수렴할 경우, 모델은 게임 설정 내에서 안전하게 반응할 수 있다. 그러나 동일한 모델을 사용하여 두 역할을 강제하는 파라미터 공유는 안정성과 성능을 향상시키지만, 이론적 및 아키텍처적 한계를 초래한다.

연구 5월 12일

권리와 법의 동조

권리와 법의 동조 법학(Jurisprudence, 법학의 기초)에 대한 연구와 인공지능 모델이 인간 가치에 맞게 동조하는 것에 대한 과학(Alignment, 동조의 과학)은 결국 같은 구조를 공유한다. 이처럼 멀리 떨어진 두 분야 모두 강력한 행위자들의(법관과 인공지능)의 미래에 대한 결정이 어떻게 이루어질지 예측하고 형성하고자 한다. 그리고 그 목표를 달성하기 위해 언어의 명세와 해석의 도구를 사용한다. 법학의 대형 토론(what the law is와 what it should be에 대한 토

AI 모델 5월 12일

정치적 플라스틱성: 대규모 언어 모델의 이념적 유연성 분석

대규모 언어 모델(LLM)의 정치적 편향에 대한 연구가 활발하게 진행되고 있지만, 이 연구에서는 대규모 언어 모델의 정치적 유연성에 대한 연구를 진행했습니다. 정치적 유연성은 사용자가 제공한 문맥에 따라 모델이 반응을 조정할 수 있는 능력을 의미합니다. 연구에서는 200개의 정치적 질문을 포함하는 확장된 코퍼스를 사용하여 이념적 변화를 분석했습니다. 결과는 시스템 프롬프트가 효과적이지 않았지만, 사용자가 제공한 프롬프트가 모델의 이념적 변화를 유도할 수 있음을 보여주었습니다.

연구 5월 12일

도구 확장 언어 모델을 위한 CoCoDA: 컴포지셔널 DAG의 공동 진화

도구 확장 언어 모델은 작은 언어 모델에 외부 실행 가능한 스킬을 추가할 수 있지만 도구 라이브러리를 확장하는 것은 새로운 재사용 가능한 서브루틴이 발생할 때 계획자와 함께 진화해야 하며, 검색은 고정된 컨텍스트 예산 내에서 유지해야 한다. 기존의 도구 사용 및 스킬 라이브러리 방법은 도구를 평평한 메모리나 텍스트 인덱스 메모리로 처리하기 때문에 라이브러리 크기에 따라 지시 첨부 비용이 증가하고, 실행 가능한 코드의 타입화된 컴포지셔널 구조가 묻힌다. 우리는 CoCoDA를 제안한다. CoCoDA는 컴포지셔널 코드 DAG를 통해 계획자와 도구 라이브러리를 공동 진화하는 프레임워크이다. 노드는 원소 또는 복합 도구로, 엣지는 호출 의존성을 인코딩하고, 각 노드는 타입화된 서명, 설명, 전/후 조건 사양, 예시를 저장한다. 추론 시간에, 타입화된 DAG 검색은 후보를 심볼릭 서명 일치로 필터링하고, 생존자들을 설명에 따라 순위 매기고, 행동 사양에 의해 필터링하고, 예시를 통해 불명확성을 해소한다. 이 때, 비용이 많이 드는 컨텍스트 재현을 점진적으로 작아지는 후보 집합에 유지한다. 훈련 시간에, 성공적인 경로를 유효화된 복합 도구로折입하고, 계획자는 DAG 유도된 보상을 사용하여 복합 도구의 원소 확장 크기에 따라 크레딧을 받는다. 우리는 검색 비용 감소, 선형 검색 시간, 형성된 보상 하에서 컴포지셔널 이점, 보수적인 업데이트하에 모노톤 공동 진화, DAG의 잘못된 형태를 보여준다. 수학적 논리, 표 형태 분석, 코드 작업 벤치마크에서, CoCoDA는 8B 학생이 GSM8K와 MATH에서 32B 교사와 일치하거나 초과하는 것을 허용하고, 강력한 도구 사용 및 라이브러리 학습 베이스 라인에 비해 지속적으로 개선한다.

AI 모델 5월 12일

인간-AI 팀의 성능 향상을 위한 다단계 프레임워크: PLACO

인간-AI 팀은 인간과 모델이 각각 성능을 달성할 수 없을 때 전체 시스템 성능을 향상시키는 데 중요한 역할을 합니다. 강력하고 접근성이 좋은 생성 AI 모델의 등장으로 인해 여러 무거운 작업이 인간-AI 팀 작업으로 변모했습니다. 인간은 AI 보조를 사용하여 이전에 경험하지 못한 속도 향상을 경험했습니다. 분류 작업에서 최종 출력은 단일 硬 라벨이기 때문에 인간과 모델 출력의 결합을 해결하는 것이 중요합니다. 이전 연구는 Bayes 규칙을 사용하여 인간과 모델 출력이 실제값에 대한 조건부 독립이라는 가정으로 이 문제를 아름답게 해결했습니다. 특히, 모델의 인스턴스 수준과 인간의 클래스 수준에 대한 계산된 확률을 사용하여 단일 결정 라벨러(인간)와 확률 라벨러(분류 모델)를 결합하는 방법을 논의했습니다.

에이전트 5월 12일

실렌스: 효율적인 LLM 에이전트를 위한 대규모 언어 모델(LLM) 경험 재사용

실렌스는 대규모 언어 모델(LLM) 에이전트가 다양한 태스크에서 절차적 경험을 재사용하는 데 있어 실용적인 방법이 되었다. 그러나 기존 시스템은 지식库를 단일 해상도 프롬프트 블록으로 다루어 왔기 때문에, 도식화된 지식은 관련성이 떨어지거나 오해를 일으킬 수 있지만, 전체 지식을 다시 작성하는 것은 비용이 많이 들고 자주 필요하지 않다. 실렌스는 지식 라이브러리를 네 개 층의 정책, 전략, 절차, 원소로 구성된 그래프에 조직하고, 다양한 해상도에서 지식을 검색하는 지식 진화 프레임워크를 제안한다. 태스크를 입력받으면, 실렌스는 의미적으로 관련된 지식 씨앗을 검색하고, 그 지식 씨앗을 확장하기 위해 지식 그래프에 대한 고도의 정정된 무작위 경로를 수행하고, 이후 각 방문 단위가 수락, 분해, 다시 작성, 건너뛰어야 하는지 결정하기 위해 검증기를 사용한다. 이로써 에이전트는 호환 가능한 서브 지식을 직접 재사용할 수 있으면서, 지역적으로 일치하지 않는 구성 요소를만 지역적으로 적응할 수 있다. 시간이 지남에 따라 시스템을 개선하기 위해, 실렌스는 다중 해상도 지식과 검증기를 개선하여 라우팅 결정력을 향상시킨다. 우리는 이론적으로 다중 해상도 적응이 희박한 일치 가정하에 선형 비용을 발생시키며, 진화적 업데이트 규칙이 유효성 목표를 지역 최적점까지 단조적으로 향상시키는 것을 보여준다. MuLocbench와 ALFWorld에서, 실렌스는 강력한 지식 기반 베이스 라인보다 일관되게 향상되어, 버그 로컬라이제이션에서 6.31%의 Acc@1 향상과 에이전트 성공률을 45.00%에서 51.31%까지 높였다다.

AI 모델 5월 12일

메모큐(MemQ): 자가진화하는 경험기억을 위한 Q러닝 통합

자연어 처리 대규모 언어 모델(LLM) 에서 경험기억을 축적하고 검색하는 것을 허용하지만, 현재의 방법은 각 기억을 독립적으로 평가하고 있기 때문에, 기억이 미래의 기억을 생성하는 의존성 체인에 대한 계산을 고려하지 못하고 있습니다. 메모큐(MemQ)는 TD(λ)가치 추적을 사용하여 기억 Q-값에 적용하고, 기억이 생성될 때 검색된 기억을 기록하는 증명성 DAG에 대한 후방 신호를 전파합니다. 신호의 가중치는 DAG의 깊이 d에 따라 (γλ)^d로 감소하고, 시간적 거리 대신 구조적 근접성을 사용합니다. 실험 결과, 6개의 벤치마크에서 메모큐(MemQ)는 일반화 평가와 런타임 학습에서 최고의 성공률을 달성했으며, 다단계 태스크에서 가장 큰 이익을 보였습니다.

인기 태그