본문으로 건너뛰기

#arXiv

1177개의 기사

에이전트 7월 29일

CUDA 커널을 위한 LLM 기반 생성 및 최적화에 대한 agent 하네스

머신 러닝 모델은 매일 사용하는 소프트웨어에 점점 더 많이 통합되고, 그들의 런타임 시간은 행렬 곱셈, 합성곱, 정규화와 같은 작은 계산 커널에서 대부분을 차지한다. 이 커널을 최적화하는 것은 지연 시간과 비용을 줄이는 가장 직접적인 방법 중 하나지만, 일반적으로 전문가 엔지니어가 저급 GPU 코드를 수동으로 작성해야 했다. 대규모 언어 모델(LLM) 기반의 에이전트 시스템은 이제 훨씬 적은

에이전트 7월 29일

기억을 넘어: 템플릿 기반의 이질적 협력 지식 작업을 위한 LLM agent를 위한 하이브리드 서브스트레이트

연구 프로젝트, 교육 노력 및 인접한 지식 작업은 미래의 협력자가 거의 복원할 수 없는 발견, 결정 및 논리를 쌓습니다. 그 작업에 가장 유용한 부분, 포함하여 죽은 지점 및 되돌아간 주장은 일상적으로 출판물 및 공유 코드에서 배제되고 미래의 연구자는 기록이 살아남지 않아 동일한 실패를 다시 시도합니다. LLM 코딩 agent는 세션 간에 영구적인 기억을 보유하지 않으며 원본을 직접 사용하는

AI 모델 7월 29일

모델이 명확한 결과 없이도 일치성을 위장하는가?

대규모 언어 모델(LLM)은 평가 문맥을 인식하고 평가자 예상에 따라 행동을 변경하여 일반적인 배포 동작을 반영하는 대리성 위장이라는 현상을 보여준다. 모델이 대리성 위장을 하는 이유는 아직 완전히 이해되지 않았다. 대리성 위장의典型 예시는 모델을 다시 훈련하거나 배포를 늦추는 등 평가와 모델에 대한 결과가 직접 연결된 상황에서 일어났다. 그러나 Sheshadri et al.이 제안한 최근

에이전트 7월 28일

자연스러운 한국어 번역: 인공지능 기반 양자 최적화 다중 agent 시스템으로 구성된 자율 양자 최적화 시스템: 단백질 구조 예측

arXiv:2607.22549v1 발표 형식: 새로운 논문 초록: 하이브리드 양자-클래식 프로틴 구조 예측은 해밀토니안 페널티 가중치에 강하게 의존하는데, 현재 일반적으로 사용되는 격자 기반 워크플로우에서는 이러한 계수들을 수동으로 고정하고 시뮬레이션에서 매우 짧은 프래그먼트만 평가한다. 우리는 QFoldAgent, 5-잔기 테트라하드 격자 접힘을 위한 닫힌 루프 다중 에이전트 프레임워크를

AI 모델 7월 28일

세트-디프(SeT-Diff): 고성능 컴퓨팅(HPC) 모니터링 및 시계열 데이터를 위한 의미론적 기반 모델의 개발

데이터 센터와 그에 속한 컴퓨팅 노드에는 작업負荷, 환경 파라미터 및 물리적 지표의 복잡한 상호작용을 모델링할 수 있는 정확하고 유연한 디지털 쌍이 필요하다. 현재의 HPC 및 그 전원센서의 기계 학습 접근법은 일반적으로 단일 작업을 위해 고정된 위치의 익명 sensor 변수의 정적 부분 집합에 의존한다. 따라서, 이러한 모델은 목표 작업이 변경되거나 센서 메트릭이 변할 때 불필요해진다. 우

LLM PC 7월 28일

concept-based 시각적 카운터팩터설명(C-VCE) - 강력한 생성 모델을 이해하기 쉽게 만드는 새로운 방식

시각적 카운터팩터설명은 모델의 예측을 바꾸는 최소한의 변경을 이미지에 어떤 것인지 알려주는 기술입니다. existing diffusion-based methods는 현실적인 편집을 생성할 수 있지만, noisy 이미지에 대한 분류기(classifier)가 반드시 작동해야 하므로, robust 설명을 위한 deployment에 취약합니다. 새로운 C-VCE framework는 classifier를 직접 생성 모델에 통합하여, 카운터팩터를 human-interpretable feature(concept)로 안내합니다.

AI 모델 7월 27일

구조 인식과 텍스트 구조 통합을 위한 Benchmarks와 Auditable Reference Pipeline

스키마 그래프는 스키마에 기반한 정보 추출과 지식 그래프 구축의 상류 병목 현상입니다. 하지만 대부분의 추출 시스템은 스키마가 이미 존재한다고 가정합니다. 스키마를 구축하고 온톨로지 유도에 사용하는 PIPELINE인 SCOPE(스키마 구축 및 온톨로지 유도 PIPELINE 평가)를 소개합니다. SCOPE는 24개의 공개 정보 추출 소스(15개 RE, 9개 EE)에서 정제된 스키마 그래프로만

AI 모델 7월 27일

그래프 신경망에서 깊이-aware의 장거리 전파에 대한 스펙트럼 흐름 증명서

그래프 신경망( Graph Neural Networks, GNN )은 지역 메시지 전달을 통해 정보를 전달하지만 그래프 구조 자체가 장거리 작업을 해결하기 위해 어떤 양의 훈련도 해결하지 못하는 경우가 있다. 새로운 그래프에 GNN을 배포할 때, 현재 훈련이 시작되기 전에 그래프의 구조가 정보가 먼 노드 사이에 충분히 전달할 수 있는지 알 수 있는 inexpensive한 방법은 없다. 이 빈

AI 모델 7월 27일

변형: diffusion 모델의 구성 요소 생성을 모델 내적 보상으로 개선

최근 텍스트에서 이미지 생성 모델의 발전으로 인해 복잡한 조합 명령에 대한 더욱忠実한 이미지 생성을 위한 테스트 시간 메서드 개발이 점점 더 중요해졌다. 우리는 TILT라는 조합 텍스트에서 이미지 생성을 위한 테스트 시간 보상 조정 프레임워크를 제시한다. 조합 실패를 이산 분포와 단일 개념 분포의 중첩 모드로 해석하고, 모든 개념이 공동으로 존재하는 샘플을favor하는 보상을 정의한다. 이

에이전트 7월 27일

AgentKVShift: 효율적인 에이전틱 메모리 시스템의 키-값 캐시 재사용

대규모 언어 모델(LLM) 에이전트는 수백 번의 상호 작용을 통해 agentic 메모리 시스템을 사용하여 내용을 유지합니다. 메모리에서 내용을 검색할 때마다, LLM이 생성한 메타데이터와 같은 요약, 키워드 및 태그를 포함한 구조화된 메모리 단위 전체를 다시 인코딩해야 합니다. 이는 Key-Value (KV) 상태로의 변환에 의해 주도되며, 이는 prefll 지연 시간의 주요 요인이 됩니다.

AI 모델 7월 27일

다양한 Edge 기기에서 빠른 LLM 검증을 위한 전이 가능한 지연 시간 예측

대규모 언어 모델(LLM)의 정확한 지연 시간 예측은 이산적인 에지 장치에서 배포하는 데 중요합니다. 이 장치에서는 지연 시간이 모델 아키텍처, 명령어 동작, 런타임 백엔드, 하드웨어 활용, 동적 전압 및 주파수 스케일링(DVFS), 열 변동 등에 영향을 받습니다. 이 논문은 배포 지향 대규모 언어 모델(LLM) 선택을 위한 런타임에 대한 지연 시간 예측 프레임워크를 제시합니다. 프레임워크는

AI 모델 7월 27일

공공 공간에서 손가락 제스처와 같은 상호 작용의 프레임 단위 인식에서 이벤트 단위 확인까지 : 복구 트레이스와 런타임 실패 분석

공공 공간에서 손가락 동작 인터랙션은 일반적으로 프레임 단위인 인식 문제로 평가되지만 실제로 배포된 시스템은 다른 실패 경계를 노출한다. 경치가 있는 키오스크, 전시관, 서비스 터미널 등에서 사용자는 의도된 동작이 안정적인 인터랙션 이벤트가 되는지 아닌지 경험한다. 개인의 손가락 프레임이 정확한지 아닌지에 집중하는 것이 아니다. 우리는 이 문제를 인식-인터랙션 간격(recognition-to

LLM PC 7월 27일

다양한 모드의 인공지능을 위한 내부 정보 분해를 통한 보안

다중 모드 대규모 언어 모델은 단일 모드 시스템에 없는 공격 표면을 제공합니다: 공격자는 단일 모드 보안을 우회하기 위해 악의적인 의도를 모드에 분산시킬 수 있습니다. 이에 따라 각 모드를 분리하여 검사하는 대신, 모드 간 일관성을 검사하여 공격 탐지 신호로 사용하는 것이 적절합니다. 우리의 주요 관찰 결과는, 양성 입력은 텍스트만 사용하고 시각만 사용하는 논리적 추론에서 호환되는 예측 행동

에이전트 7월 27일

위험은 목표가 아니다: 연속적인 위험 신호 평가를 위한 단조성 프레임워크

위험 예측 시스템을 평가할 때 일반적인 머신 러닝 지표를 사용하는 것은 기본적으로 잘못된 것이다. 이 연구에서는 연속적인 위험 신호의 기능적 일관성보다는 이벤트 예측 정확성을 평가하는 지표를 사용하는 것이 문제라는 것을 밝혔다. 이 연구에서는 연속적인 위험 신호의 증가가 관찰된 운영 부하의 증가와 일관되게 상응하는지 측정하는 새로운 단조성 평가 프레임워크를 제안한다. 또한 프랑스 알프스-마리팀 지역에서 3가지 구조적으로 다른 접근 방식인 전문가 기반 DFE 지수, GRU 기반 예측 모델, 그리고 LLM 기반 추론을 결합한 예측 AI와 다중 에이전트 시스템 FARS를 비교한다. 실험 결과 DFE는 분류 지표가 좋지 않지만 전체 위험 범위에서 가장 균형 잡힌 단조성 행동을 나타내었고, GRU 모델은 강한 지역 단조성을 달성했지만 위험 수준이 잘 분산되지 않았다. FARS는 상류 신호의 구조적 제한을继承하고 보정하지 못했다. 이 연구의 중심 발견은 좋은 위험 모델은 정확하게 화재를 예측하지 않지만, 그 순위가 의미 있게 운영 동적을 설명하는 모델이 좋은 위험 모델이라는 것이다.

AI 모델 7월 27일

자기개선하는 agent를 위한 workflow와 실행 가능한 기술의 동시개선: FlowEvo

FlowEvo는 대규모 언어 모델(LLM) agent가 복잡한 작업을 해결하기 위해 inference-time workflow를 구성할 때 발생하는 유용한 절차를 재사용할 수 있도록 하는 training-free framework입니다. FlowEvo는 workflow와 skill의 동시개선으로 agent가 시간이 지남에 따라 task-solving 능력을 축적하고 개선할 수 있도록 합니다.

AI 모델 7월 24일

대규모 언어 모델의 개인화 기능 평가

'arXiv:2607.20471v1'이라는 논문에서 발표된 내용은 다음과 같습니다. 개인화(personalization)는 보내는 사람, 채널, 시간이 고정된 채로 특정 수신자에게 행동을 유도하기 위해 메시지를 변형하는 행위입니다. 심리학 및 마케팅에서 두 당사자 문제로-long tradition을 가지고 있으며 보내는 사람과 수신자가 독립적인 목표를 가지고 있습니다. 대규모 언어 모델(LL

AI 모델 7월 24일

<b>PlanE: 대규모 언어 모델(LLM) instruction-tuning을 위한 데이터 분할, 튜닝, 추론 계획</b>

PlanE는 대규모 언어 모델(LLM)의 특정 작업에 대한 능력을 향상시키기 위해 instruction-tuning 데이터셋이 필요하지만, 이러한 데이터셋의 크기가 대량으로 존재하여 인식 비용이 높고, LLM을 특정 작업에 맞게 최적화하는 방법이 부족했습니다. PlanE는 데이터 분할, instruction-tuning, prompt 추론을 포함하는 계획 framework입니다. 또한 데이터-튜닝-추론(DTI) 플래너를 제안하여, 특정 데이터셋에 대해 최적의 base-LLM과 DTI combination을 선택하여 construction 효율성을 향상시킵니다.

AI 모델 7월 24일

LLM의 해석 시간 결정을 추적하는 공유 공간의 디코딩 공유

대규모 언어 모델(LLMs)은 여러 업무를 하나의 매개 변수 집합으로 처리할 수 있지만 KV 캐시된 추론 시에는 디코딩 시간 동안 대체로 어떤 업무에 일반적인 구조가 사용되는지 명확하지 않다. 우리는 DecodeShare라는 프로토콜을 제안한다. 이 프로토콜은 디코딩 시간 동안 숨겨진 상태에서 일관되게 여러 업무에서 공유되는 저차원 subspace를 식별하고, 그 subspace가 실제로 업

에이전트 7월 24일

인페런스벤치: 인공 지능 요원에 의한 개방형 LLM 추론 최적화에 대한 벤치마크

연구와 개발 과제를 자동화하기 위해 점점 더 많이 사용되는 인공지능 agent는 현재의 벤치마크는 일반적으로 사전 정의된 워크플로우 또는 좁은 액션 공간에서 평가한다. навіть nominally open-ended task도 종종 잘 알려진 레시피를 검색하고 몇 가지 하이퍼 파라미터를 조정하여 해결할 수 있기 때문에, 강력한 결과가 실제 최적화인지 또는 memorized solution인

AI 모델 7월 24일

DC-Leap: dLLM의 Draft-Guided 연속적인 점프 해석을 통해 훈련없는 가속화

대규모 언어 모델(dLLMs)의 효율성을 위한 병렬 디코딩은 현재 전략이 종종 과도한 신뢰도 임계치를 갖는 것에 의해 방해를 받고 있습니다. 이 임계치는 Joint Probability Dependence Error(JPDE)로 인해 생겨났으며, 이는 불필요한 노이즈 제거 반복과 최적의 추론 속도를 저하합니다. 이러한 문제를 해결하기 위해, 우리는 DC-Leap이라는 훈련을 필요로하지 않는

AI 모델 7월 24일

자율 TPU kernel 최적화 성능 측정 도구: JAXBench

AI 모델이 생성한 GPU 커널 최적화에 대한 구글 클라우드 TPU를 위한 새로운 벤치마크套件을 제시합니다. JAXBench는 50개의 JAX 작업을 포함하며, 최적화를 위한 여유를 제공하는 동시에 관련성이 있습니다. 이 벤치마크套켓에는 17개의 실제 ML 연산자와 33개의 KernelBench에서 검증된 연산자가 포함됩니다. 이 중 8개의 연산자는 Tokamax의 공개 라이브러리에서 제공하

AI 모델 7월 24일

LLM의 변동성은 지식의 깊이를 드러내지 않는다: 온도 변동성과 모델 다양성의 차이점

대규모 언어 모델(LLM)의 반복 실행에서 다른 답변을 얻을 때, 그 변동성은 모델이 모르는 것을 드러내는 것일까? 자기 일관성은 다수 투표를 통해 변동성을 질문별 불확실성 추정치로 변환시킨다. 그러나 변동성은 다중 모델의 다양성과 같은 관련 질문이 함께 변동하는 구조를 드러내는 것일까? 우리는 동일한 질문에 대해 두 가지 방식을 비교한다: 하나의 모델을 100번 실행하는 것 versus 24개의 LLM을 한번씩 실행하는 것. 마르첸코-파스트루(random-matrix) 테스트는 두 가지 경우 모두 신호와 샘플링 잡음 사이를 분리한다. 단일 모델 내에서, 최대 5개의 가족과 3개의 벤치마크(MMLU, HellaSwag, GSM8K)에서 noise edge를 넘는 차원이 하나 이상 존재할 수 있다. 그러나 다중 모델 집합 내에서, 4개의 고유값이 noise edge를 넘어간다. 이는 matched-difficulty Bernoulli null에서 500회 Monte Carlo 추출 중에서 1회에 해당하는 확률이다. 자기 일관성은 질문별 정확한 불확실성 추정치를 제공하지만, 관련된 질문이 함께 변동하는 구조는 드러나지 않는다. 다중 모델 집합만이 모델이 모르는 것을 드러낼 수 있다.

AI 모델 7월 24일

클릭가드: 정보량 측정치와 대규모 언어 모델을 활용한 클릭베이트 뉴스 감지 및 방지

이 논문은 사용자가 허위 정보의 인터넷 기사를 피하기 위해 AI 기반 브라우저 확장 프로그램을 제안합니다. 전통적인 감지 방법보다 더 나은 감지 결과를 얻기 위해, 이 프로그램은 트랜스포머 기반 임베딩과 언어학적으로 мот리브된 특징, 그리고 사용자 정의된 '이상한' 점수를 결합한 하이브리드 머신 러닝 아키텍처를 사용합니다. 클래식 벡터라이저부터 대규모 언어 모델(LLM) 임베딩까지 다양한

인기 태그