본문으로 건너뛰기

#추론

574개의 기사

에이전트 7월 27일

AgentKVShift: 효율적인 에이전틱 메모리 시스템의 키-값 캐시 재사용

대규모 언어 모델(LLM) 에이전트는 수백 번의 상호 작용을 통해 agentic 메모리 시스템을 사용하여 내용을 유지합니다. 메모리에서 내용을 검색할 때마다, LLM이 생성한 메타데이터와 같은 요약, 키워드 및 태그를 포함한 구조화된 메모리 단위 전체를 다시 인코딩해야 합니다. 이는 Key-Value (KV) 상태로의 변환에 의해 주도되며, 이는 prefll 지연 시간의 주요 요인이 됩니다.

AI 모델 7월 27일

다양한 Edge 기기에서 빠른 LLM 검증을 위한 전이 가능한 지연 시간 예측

대규모 언어 모델(LLM)의 정확한 지연 시간 예측은 이산적인 에지 장치에서 배포하는 데 중요합니다. 이 장치에서는 지연 시간이 모델 아키텍처, 명령어 동작, 런타임 백엔드, 하드웨어 활용, 동적 전압 및 주파수 스케일링(DVFS), 열 변동 등에 영향을 받습니다. 이 논문은 배포 지향 대규모 언어 모델(LLM) 선택을 위한 런타임에 대한 지연 시간 예측 프레임워크를 제시합니다. 프레임워크는

LLM PC 7월 27일

다양한 모드의 인공지능을 위한 내부 정보 분해를 통한 보안

다중 모드 대규모 언어 모델은 단일 모드 시스템에 없는 공격 표면을 제공합니다: 공격자는 단일 모드 보안을 우회하기 위해 악의적인 의도를 모드에 분산시킬 수 있습니다. 이에 따라 각 모드를 분리하여 검사하는 대신, 모드 간 일관성을 검사하여 공격 탐지 신호로 사용하는 것이 적절합니다. 우리의 주요 관찰 결과는, 양성 입력은 텍스트만 사용하고 시각만 사용하는 논리적 추론에서 호환되는 예측 행동

에이전트 7월 27일

위험은 목표가 아니다: 연속적인 위험 신호 평가를 위한 단조성 프레임워크

위험 예측 시스템을 평가할 때 일반적인 머신 러닝 지표를 사용하는 것은 기본적으로 잘못된 것이다. 이 연구에서는 연속적인 위험 신호의 기능적 일관성보다는 이벤트 예측 정확성을 평가하는 지표를 사용하는 것이 문제라는 것을 밝혔다. 이 연구에서는 연속적인 위험 신호의 증가가 관찰된 운영 부하의 증가와 일관되게 상응하는지 측정하는 새로운 단조성 평가 프레임워크를 제안한다. 또한 프랑스 알프스-마리팀 지역에서 3가지 구조적으로 다른 접근 방식인 전문가 기반 DFE 지수, GRU 기반 예측 모델, 그리고 LLM 기반 추론을 결합한 예측 AI와 다중 에이전트 시스템 FARS를 비교한다. 실험 결과 DFE는 분류 지표가 좋지 않지만 전체 위험 범위에서 가장 균형 잡힌 단조성 행동을 나타내었고, GRU 모델은 강한 지역 단조성을 달성했지만 위험 수준이 잘 분산되지 않았다. FARS는 상류 신호의 구조적 제한을继承하고 보정하지 못했다. 이 연구의 중심 발견은 좋은 위험 모델은 정확하게 화재를 예측하지 않지만, 그 순위가 의미 있게 운영 동적을 설명하는 모델이 좋은 위험 모델이라는 것이다.

AI 모델 7월 27일

자기개선하는 agent를 위한 workflow와 실행 가능한 기술의 동시개선: FlowEvo

FlowEvo는 대규모 언어 모델(LLM) agent가 복잡한 작업을 해결하기 위해 inference-time workflow를 구성할 때 발생하는 유용한 절차를 재사용할 수 있도록 하는 training-free framework입니다. FlowEvo는 workflow와 skill의 동시개선으로 agent가 시간이 지남에 따라 task-solving 능력을 축적하고 개선할 수 있도록 합니다.

AI 모델 7월 24일

<b>PlanE: 대규모 언어 모델(LLM) instruction-tuning을 위한 데이터 분할, 튜닝, 추론 계획</b>

PlanE는 대규모 언어 모델(LLM)의 특정 작업에 대한 능력을 향상시키기 위해 instruction-tuning 데이터셋이 필요하지만, 이러한 데이터셋의 크기가 대량으로 존재하여 인식 비용이 높고, LLM을 특정 작업에 맞게 최적화하는 방법이 부족했습니다. PlanE는 데이터 분할, instruction-tuning, prompt 추론을 포함하는 계획 framework입니다. 또한 데이터-튜닝-추론(DTI) 플래너를 제안하여, 특정 데이터셋에 대해 최적의 base-LLM과 DTI combination을 선택하여 construction 효율성을 향상시킵니다.

AI 모델 7월 24일

LLM의 해석 시간 결정을 추적하는 공유 공간의 디코딩 공유

대규모 언어 모델(LLMs)은 여러 업무를 하나의 매개 변수 집합으로 처리할 수 있지만 KV 캐시된 추론 시에는 디코딩 시간 동안 대체로 어떤 업무에 일반적인 구조가 사용되는지 명확하지 않다. 우리는 DecodeShare라는 프로토콜을 제안한다. 이 프로토콜은 디코딩 시간 동안 숨겨진 상태에서 일관되게 여러 업무에서 공유되는 저차원 subspace를 식별하고, 그 subspace가 실제로 업

에이전트 7월 24일

인페런스벤치: 인공 지능 요원에 의한 개방형 LLM 추론 최적화에 대한 벤치마크

연구와 개발 과제를 자동화하기 위해 점점 더 많이 사용되는 인공지능 agent는 현재의 벤치마크는 일반적으로 사전 정의된 워크플로우 또는 좁은 액션 공간에서 평가한다. навіть nominally open-ended task도 종종 잘 알려진 레시피를 검색하고 몇 가지 하이퍼 파라미터를 조정하여 해결할 수 있기 때문에, 강력한 결과가 실제 최적화인지 또는 memorized solution인

AI 모델 7월 24일

DC-Leap: dLLM의 Draft-Guided 연속적인 점프 해석을 통해 훈련없는 가속화

대규모 언어 모델(dLLMs)의 효율성을 위한 병렬 디코딩은 현재 전략이 종종 과도한 신뢰도 임계치를 갖는 것에 의해 방해를 받고 있습니다. 이 임계치는 Joint Probability Dependence Error(JPDE)로 인해 생겨났으며, 이는 불필요한 노이즈 제거 반복과 최적의 추론 속도를 저하합니다. 이러한 문제를 해결하기 위해, 우리는 DC-Leap이라는 훈련을 필요로하지 않는

AI 모델 7월 24일

의학 텍스트에서 LLM 워터마크의 오류: 의료 성능 평가

의학 텍스트에서 대규모 언어 모델(LLM)의 워터마크가 의료 성능에 미치는 영향을 조사한 연구가 발표되었습니다. 연구 결과, 워터마크가 의료 텍스트의 의미를 바꾸거나 의학적 오류를 유발할 수 있음을 발견했습니다. 이러한 결과는 의학 분야에서 워터마크를 안전하게 사용하기 위한 새로운 평가 기준을 제시합니다.

허깅페이스 7월 23일

4비트 diffusion inference를 diffuser에 적용하기

Meta는 새로운 대화 AI 플랫폼인 Llama 2를 출시했습니다. 이 플랫폼은 Meta의 대규모 언어 모델(LLM) 기반으로 개발되었으며, 사용자들이 AI와 자연스럽게 대화할 수 있도록 설계되었습니다. Llama 2는 이전 버전의 AI와 달리 더 강력하고 유연한 대화 능력을 갖추고 있습니다. AI는 사용자들이 말하는 대로 질문을 던질 수 있고, 사용자들의 경험과 지식을 기반으로 새로운 아이

AI 모델 7월 23일

LLM agent를 위한 프로파일 그래프 메모리: 내재된 엔터티 간 전이의 이야기 프로필을 통해

장기 기억은 세션 간 상호 작용하는 LLM agent에 필수적이나 현재 기억 평가 지표는 주로 단일 hop recall를 평가하며, 다중 hop 연관은 거의 측정되지 않았다. 우리는 세 가지 contribution을 제시한다. 첫째로, 우리는 MemHop이라는 다중 hop 기억 평가 지표를 1,000 개의 질문과 hop 깊이 1-5, 10 개의 사회 네트워크 시나리오를 포함하여, per-ho

AI 모델 7월 23일

LISA: 선형 인덱스 스파스 주의(LISA) - 효율적인 장기 논리적 추론을 위한 새로운 기술

장기 논리적 추론 모델의 최근 발전으로 인해 테스트 시간 척도 패러다임 하에서 더 긴 추론 문맥 길이가 증가하고 있습니다. 그러나 표준 자기 주의의 O(n^2) 계산 복잡성으로 인해 장기-CoT 논리적 추론의 배포는 생산 환경에서 제한됩니다. 이를 해결하기 위해 우리는 LISA(LISA)를 제안합니다. LISA는 원래 모델에 플러그 앤 플레이 주의 대체 모듈로 사용할 수 있는 플러그 앤 플레이 주의 대체 모듈입니다. LISA는 원래 모델에 두 가지 가벼운 구성 요소를 병렬로 통합합니다: (1) 선형 주의 모듈이 장거리 기억을 제공하는 O(n) 시간 복잡도; (2) 광속 인덱서가 전체 문맥에서 토큰의 상위 M을 선택하여 광속 자기 주의에 입력합니다. 두 가지 Branch는 게이트 메커니즘을 통해 결합되며, n 토큰을 생성하는 데 O(n^2)에서 O(nM) (M << n)로의 예측 복잡성을 줄입니다.

AI 모델 7월 23일

확률적 프라임-듀얼 디코딩을 위한 다목적 생성 추천 시스템

추천 시스템(RS)의 최근 발전은 생성 모델링을 통해 상당한 성능 향상을 보여주었다. 실제로는 추천이 종종 아이템 속성을 정의한 제약이나 공정성 제약과 같은 여러 목표를 만족해야 하는 순서가 있는 아이템 목록인 슬레이트를 구성하는 데 관여한다. 존재하는 다목적 접근법은 대부분 비생산적 환경을 위한 후처리 기술에 의존하거나 모델 훈련에auxiliary 목표를 직접 통합한다. 후자는 대규모 시스

AI 모델 7월 23일

대형 언어 모델에서 정보 판단

기존의 검색 엔진을 대체할 대규모 언어 모델(LLM)은 인터넷과 같은 외부 지식 소스를 사용하기도 한다. 이 모델들이 정보를 적절히 가중치로 부여하며, 신뢰할 수 있는 소스를 더 많이 고려하고 (소스 판단력) 진실한 정보가 더 가까워질 때 claim을 더 많이 업데이트 하는가? 우리는 이 문제를 정보 판단력으로 정의하고, 세 가지 명제적 원칙에 기반한 interpretable metrics를

LLM PC 7월 23일

인텔 TDX 하위 NVIDIA H100에서 신뢰할 수 있는 GPU 추론 성능 측정

기밀 처리는 sensitive한 입력을 처리하거나 사설 모델 자산을 보호하기 위해 AI 인식 작업을 위한 실질적인 배포 요구 조건이 되고 있습니다. 그러나 GPU 가속된 대규모 언어 모델 서비스를 위해 기밀 처리를 활성화하는 성능 비용은 작업 부하에 따라 달라지고 operationally 중요합니다. 이 논문은 NVIDIA H100 80GB GPU를 Intel TDX 기밀 인스턴스에 호스트한

AI 모델 7월 22일

정확도와 비용만 고려하지 말고 지연 시간을 고려한 동적 워크로드를 위한 LLM 쿼리 라우팅

최신 언어 질의 라우터는 질의를 각 모델에 할당하여 반응 품질과 금전적 비용을 균형에 맞게 향상시켜 추론 효율성을 개선한다. 그러나 현재의 질의 라우터는 대다수가 지연 시간에 무관하고 모델 인스턴스에서 질의가 경험하는 생성 지연 시간을 고려하지 않는다. 실제로 지연 시간은 모델 정확도나 추론 비용을 고려하지 않고 라운드 로빈이나 가장 짧은 대기열에 합류하는 정책과 같은 로드 밸런싱 정책으로

에이전트 7월 22일

구조화된 agent 평가 및 근거付け

대규모 언어 모델(LLM)의 에이전트 호출 평가에서 정확도만을 고려하는 것은 다양한 실패 모드의 차이를 가려버린다. 모델이 올바른 함수를 선택했더라도 인자 값을 허구로 만들거나, 스키마를 만족하면서도 잘못된 이유로 에이전트를 선택할 수 있다. 기존 벤치마크는 이러한 차이를 단일 이진 점수로 압축하기 때문에, 실무자들은 에이전트 호출이 실패하는 곳을 진단할 수 없다. 우리는 SAAG이라는 연쇄

에이전트 7월 22일

Agent 실패 경로에서부터 경량화된 잔여 위험까지: 강화된 역할 AI를 위한 구성 요소 기반 프레임워크

인공지능(AI) 시스템의 신뢰성 제한을 초과하는 속도로 신뢰를 넘어가는 에이전트 AI가 발생하고 있지만, 현재의 위험 모델은 이를 표현할 수 없다는 문제가 있다. 기존의 방법은 두 가지 부분적인 관점 중 하나만 제공한다. 그 방법은 실패 메커니즘을 설명하는 것인데, 그 결과로 전달할 수 있는 잔여 위험 추정치가 생성되지 않는다. 또는 위험 추정치를 생성하면서 내부 실패 경로를 블랙 박스로 다

AI 모델 7월 21일

컨텍스트 리랭킹과 삭감을 위한 협력 게임 관점의 셰플리 컨텍스트 삭감

modern Retrieval-Augmented Generation(RAG) 시스템의 효율성을 향상시키기 위해 Context reranking과 pruning은 필수적이 되면서도 해석 가능한 통합 프레임워크는 여전히 탐구되지 않은 상태이다. 이전 연구는 주로 어휘 검색, 크로스 인코더 아키텍처, 모델 학습 distillation, Low-Rank Adaptation(LoRA) 등에 중점을 두

인기 태그