본문으로 건너뛰기

#arXiv

1177개의 기사

AI 모델 7월 24일

의학 텍스트에서 LLM 워터마크의 오류: 의료 성능 평가

의학 텍스트에서 대규모 언어 모델(LLM)의 워터마크가 의료 성능에 미치는 영향을 조사한 연구가 발표되었습니다. 연구 결과, 워터마크가 의료 텍스트의 의미를 바꾸거나 의학적 오류를 유발할 수 있음을 발견했습니다. 이러한 결과는 의학 분야에서 워터마크를 안전하게 사용하기 위한 새로운 평가 기준을 제시합니다.

에이전트 7월 24일

자율 테스트 관리를 위한 집행적 AI 아키텍처(Agentic AI Architecture) - 생성적 지능, 보안 클라우드 통신 및 적응적 품질 분석

최신 소프트웨어 품질 보증의 요구는 분산된 클라우드 환경에서 적응적 의사 결정을 위한 지능적이고 자율적인 시스템을 đòi합니다. 이 논문은 AINTMA (Agentic Intelligent Test Management Architecture)라는 다중 에이전트의 지적 인공지능 시스템을 제시합니다. 이 시스템은 기존의 테스트 관리를 자율적인 품질 지능 생태계로 바꾸어 줍니다. AINTMA는 클

AI 모델 7월 23일

LLM agent를 위한 프로파일 그래프 메모리: 내재된 엔터티 간 전이의 이야기 프로필을 통해

장기 기억은 세션 간 상호 작용하는 LLM agent에 필수적이나 현재 기억 평가 지표는 주로 단일 hop recall를 평가하며, 다중 hop 연관은 거의 측정되지 않았다. 우리는 세 가지 contribution을 제시한다. 첫째로, 우리는 MemHop이라는 다중 hop 기억 평가 지표를 1,000 개의 질문과 hop 깊이 1-5, 10 개의 사회 네트워크 시나리오를 포함하여, per-ho

AI 모델 7월 23일

LISA: 선형 인덱스 스파스 주의(LISA) - 효율적인 장기 논리적 추론을 위한 새로운 기술

장기 논리적 추론 모델의 최근 발전으로 인해 테스트 시간 척도 패러다임 하에서 더 긴 추론 문맥 길이가 증가하고 있습니다. 그러나 표준 자기 주의의 O(n^2) 계산 복잡성으로 인해 장기-CoT 논리적 추론의 배포는 생산 환경에서 제한됩니다. 이를 해결하기 위해 우리는 LISA(LISA)를 제안합니다. LISA는 원래 모델에 플러그 앤 플레이 주의 대체 모듈로 사용할 수 있는 플러그 앤 플레이 주의 대체 모듈입니다. LISA는 원래 모델에 두 가지 가벼운 구성 요소를 병렬로 통합합니다: (1) 선형 주의 모듈이 장거리 기억을 제공하는 O(n) 시간 복잡도; (2) 광속 인덱서가 전체 문맥에서 토큰의 상위 M을 선택하여 광속 자기 주의에 입력합니다. 두 가지 Branch는 게이트 메커니즘을 통해 결합되며, n 토큰을 생성하는 데 O(n^2)에서 O(nM) (M << n)로의 예측 복잡성을 줄입니다.

AI 모델 7월 23일

확률적 프라임-듀얼 디코딩을 위한 다목적 생성 추천 시스템

추천 시스템(RS)의 최근 발전은 생성 모델링을 통해 상당한 성능 향상을 보여주었다. 실제로는 추천이 종종 아이템 속성을 정의한 제약이나 공정성 제약과 같은 여러 목표를 만족해야 하는 순서가 있는 아이템 목록인 슬레이트를 구성하는 데 관여한다. 존재하는 다목적 접근법은 대부분 비생산적 환경을 위한 후처리 기술에 의존하거나 모델 훈련에auxiliary 목표를 직접 통합한다. 후자는 대규모 시스

에이전트 7월 23일

도구 사용하는 LLM agent의 구조화된 런타임 안전성: NEXUS

대규모 언어 모델(LLM) 에이전트가 점점 더 큰 영향을 미치는 행동을 수행하기 때문에 실행 중 안전성을 감시하는 것이 필수적이 되었다. 우리는 NEXUS (Neural EXecution Utility and Safety)라는 구조화된 계획 안전 모니터를 제시한다. NEXUS는 공식적인 조치 정책을 적용하여 네 가지 행동 중 하나를 선택할 수 있다: 허용, 차단, 확인 요청, 또는 수정 요청

AI 모델 7월 23일

대형 언어 모델에서 정보 판단

기존의 검색 엔진을 대체할 대규모 언어 모델(LLM)은 인터넷과 같은 외부 지식 소스를 사용하기도 한다. 이 모델들이 정보를 적절히 가중치로 부여하며, 신뢰할 수 있는 소스를 더 많이 고려하고 (소스 판단력) 진실한 정보가 더 가까워질 때 claim을 더 많이 업데이트 하는가? 우리는 이 문제를 정보 판단력으로 정의하고, 세 가지 명제적 원칙에 기반한 interpretable metrics를

연구 7월 23일

스프레드시트 형식 전환을 위한 자연어를 활용한 자동 전환 시스템

세계적으로 수백만 명이 사용하는 스프레드시트 어플리케이션의 공식 작성은 여전히 큰 장벽이다. 기존 접근 방법은 정적인 지도 학습 데이터에 의존하는데, 이는 한정된 레이블링 데이터에 의해 빠르게飽和된다. 이 논문에서 우리는 FORMULASPIN이라는 자기 플레이 프레임워크를 소개한다. 이는 지도 학습의 초과fine-tuning의 한계를 깨뜨리는 자기 개선의 반복을 가능하게 하며, 추가적인 데이

LLM PC 7월 23일

인텔 TDX 하위 NVIDIA H100에서 신뢰할 수 있는 GPU 추론 성능 측정

기밀 처리는 sensitive한 입력을 처리하거나 사설 모델 자산을 보호하기 위해 AI 인식 작업을 위한 실질적인 배포 요구 조건이 되고 있습니다. 그러나 GPU 가속된 대규모 언어 모델 서비스를 위해 기밀 처리를 활성화하는 성능 비용은 작업 부하에 따라 달라지고 operationally 중요합니다. 이 논문은 NVIDIA H100 80GB GPU를 Intel TDX 기밀 인스턴스에 호스트한

에이전트 7월 23일

OpenEvoShield: 오픈월드 다중 agent 시스템 공격을 위한 이중 비정상 지속적인 방어

LLM 기반 다기능.agent 시스템(LLM-MAS)은 점점 더 안전한 애플리케이션에서 배포되고 있으며, 공격자가 서로간의 통신을 통해 해로운 행동을 퍼뜨리기 위해 악성 명령을 주입하는 공격을 받고 있습니다. 정적 위협과 달리 이러한 공격은 두 배의 동적 공격입니다. 공격자는 배포된 방어를 반영하여 주입 전략을 개선하고 정상 agent의 행동은 시스템 확장과 함께 드리프트합니다. 기존 방어는

AI 모델 7월 23일

합성 LSTM-그래프 신경망 프레임워크를 이용한 강건 금융 위조 탐지 및 적대적 내성

금융 기관은 고도의 사기 거래를 감지하는 데에 어려움을 겪고 있습니다. 예를 들어, 스뫼핑(smurfing)과 레이어링(layering)과 같은 거래를 감지하는 데에는 극심한 데이터 불균형(0.13% 사기 거래율)이 있으며, 적대적 도피술술(evasion tactics)이 변형되고 있습니다. 이 논문에서는 FraudShield AI라는 하이브리드 프레임워크를 제안합니다. FraudShield

AI 모델 7월 23일

세부하게 구분된 FineServe: 전 세계 LLM 서비스 작업 부하의 특성화 및 데이터셋

대규모 언어 모델(LLM)의 온라인 서비스 효율성을 향상시키는 시스템 문제가 되고 있습니다. 낮은 지연 시간과 높은 처리량을 달성하기 위해서는 실제-world 서비스 작업 로드에 대한 깊은 이해가 필요하지만, 기존 연구들은 대리 트레이스나 단순화된 특성화에 의존하여 현대 멀티 모델 LLM 플랫폼의 다양성을 포착하지 못합니다. 우리는 FineServe라는 실제-world 서비스 동적의 미세 특

AI 모델 7월 22일

자연어로 된 모델링을 기반으로하는 인터랙티브 최적화 솔버

최근 대규모 언어 모델(LLM)의 발전으로 인해 실제 세계의 의사결정 문제를 자연어로 표현한 후 이를 수식적 수학적 공식으로 변환하고, 실행 가능한 해결책 코드로 변환하는 프로세스를 자동화하는 데 hứ부가 있는 결과가 나왔지만, 대부분의 기존 접근 방식은 한 번에 한 번만 수행된다. 즉, 모델은 한 번에 한 번만 수식화를 생성하고, 해결책의 피드백을 바탕으로 조건을 설정하지도 않고, 오류를

에이전트 7월 22일

LLM 기반의 다중 agent 시스템에서 contribution attribution에 대한 협동적 의미적 게임

LSTM 기반 다중 agent 시스템에서 최종 출력은 여러 agent, 메시지 교환, 순서에 의한 workflow 의존성으로 생성된다. 현재의 attribution 방법은 대개 counterfactual valuation을 통해 agent를 제거하거나 score의 변화 비교를 통해 agent 서브셋의 변화에 따른 score의 변화를 분석한다. 그러나 이러한 방법은 repeated model

AI 모델 7월 22일

정확도와 비용만 고려하지 말고 지연 시간을 고려한 동적 워크로드를 위한 LLM 쿼리 라우팅

최신 언어 질의 라우터는 질의를 각 모델에 할당하여 반응 품질과 금전적 비용을 균형에 맞게 향상시켜 추론 효율성을 개선한다. 그러나 현재의 질의 라우터는 대다수가 지연 시간에 무관하고 모델 인스턴스에서 질의가 경험하는 생성 지연 시간을 고려하지 않는다. 실제로 지연 시간은 모델 정확도나 추론 비용을 고려하지 않고 라운드 로빈이나 가장 짧은 대기열에 합류하는 정책과 같은 로드 밸런싱 정책으로

AI 모델 7월 22일

MILP-Evo: MILP 해결기 자동 설계

대규모 언어 모델(LLM)을 이용한 밀린터 선형 프로그래밍(MILP) 솔버 논리는 데이터 주도 정책이 MILP 솔버를 가속화 할 수 있음을 보여주었지만, 많은 이러한 접근 방식은 학습된 정책이 외부 예측기나 다른 불투명 모델로 표현되기 때문에 검사, 적응 및 배포가 어려울 수 있습니다. 반면에 명시적 솔버 논리는 더 쉽게 이해하고 통합 할 수 있지만 보통 학습이 아닌 솔버 피드백으로부터 직접

연구 7월 22일

드론의 운동 안정화를 위한 분산 피드백 제어에 의한 구면 적분-미분 방정식

이 논문에서는 분산 피드백 제어의 형태인 적분 연산자 형태의 드론 운동의 각도 안정화를 제안한다. 이 적분 연산자의 기억이 무한히 커질 수도 있다. 관찰 시간의 길이가 클수록, 이전 상태를 기반으로 하는 제어를 향상시키기 위한 새로운 가능성이 열린다. 제어에서 무한한 기억이 필요하기 때문에, 무한한 기억을 가진 적분 연산자에 대한 정적분 방정식의 연구에 대한 표준적인 접근 방식과 다른 새로운

LLM PC 7월 22일

Phionyx: 결정론적인 AI 런타임 아키텍처에 구조화된 상태 관리 및 전 처리 정부를 지원하는 시스템

연구자들은 Phionyx라는 이름의 새로운 AI 런타임 아키텍처를 제시했다. Phionyx는 Echoism 상호 작용 프레임워크의 확장 버전으로, AI 엔지니어링에 '통치'를 우선시하는 접근법을 도입한다. Phionyx는 확률적 agent와 달리, 확률적 상태 전진 방정식에 의해 지배되는 구조화된 상태 벡터를 사용하여 확률적 상태 전진 방정식을 사용하지 않고, 결정론적 상태 전진을 강제한다.

에이전트 7월 22일

구조화된 agent 평가 및 근거付け

대규모 언어 모델(LLM)의 에이전트 호출 평가에서 정확도만을 고려하는 것은 다양한 실패 모드의 차이를 가려버린다. 모델이 올바른 함수를 선택했더라도 인자 값을 허구로 만들거나, 스키마를 만족하면서도 잘못된 이유로 에이전트를 선택할 수 있다. 기존 벤치마크는 이러한 차이를 단일 이진 점수로 압축하기 때문에, 실무자들은 에이전트 호출이 실패하는 곳을 진단할 수 없다. 우리는 SAAG이라는 연쇄

에이전트 7월 22일

Agent 실패 경로에서부터 경량화된 잔여 위험까지: 강화된 역할 AI를 위한 구성 요소 기반 프레임워크

인공지능(AI) 시스템의 신뢰성 제한을 초과하는 속도로 신뢰를 넘어가는 에이전트 AI가 발생하고 있지만, 현재의 위험 모델은 이를 표현할 수 없다는 문제가 있다. 기존의 방법은 두 가지 부분적인 관점 중 하나만 제공한다. 그 방법은 실패 메커니즘을 설명하는 것인데, 그 결과로 전달할 수 있는 잔여 위험 추정치가 생성되지 않는다. 또는 위험 추정치를 생성하면서 내부 실패 경로를 블랙 박스로 다

연구 7월 22일

대규모 AI 도구 발견: 모든 것이 DNS에 있다

인공지능(AI)_AGENT가 자율적으로 작동하는 시대가 다가오고 있습니다. 이러한 자율 AI_AGENT를 위한 발견 메커니즘은 수백만 개의 도구를 탐색할 수 있어야 하지만, 현재의 해결책은 O(N) 복잡도와 중앙집중화된 통제를 가지고 있기 때문에 무너집니다. 또 다른 취약한 Overlay를 구축하기 보다는, 우리는 도메인 이름 시스템(DNS, Domain Name System)을 Intern

인기 태그