본문으로 건너뛰기
LLM PC 7월 23일

인텔 TDX 하위 NVIDIA H100에서 신뢰할 수 있는 GPU 추론 성능 측정

기밀 처리는 sensitive한 입력을 처리하거나 사설 모델 자산을 보호하기 위해 AI 인식 작업을 위한 실질적인 배포 요구 조건이 되고 있습니다. 그러나 GPU 가속된 대규모 언어 모델 서비스를 위해 기밀 처리를 활성화하는 성능 비용은 작업 부하에 따라 달라지고 operationally 중요합니다. 이 논문은 NVIDIA H100 80GB GPU를 Intel TDX 기밀 인스턴스에 호스트한

LLM PC 7월 22일

Phionyx: 결정론적인 AI 런타임 아키텍처에 구조화된 상태 관리 및 전 처리 정부를 지원하는 시스템

연구자들은 Phionyx라는 이름의 새로운 AI 런타임 아키텍처를 제시했다. Phionyx는 Echoism 상호 작용 프레임워크의 확장 버전으로, AI 엔지니어링에 '통치'를 우선시하는 접근법을 도입한다. Phionyx는 확률적 agent와 달리, 확률적 상태 전진 방정식에 의해 지배되는 구조화된 상태 벡터를 사용하여 확률적 상태 전진 방정식을 사용하지 않고, 결정론적 상태 전진을 강제한다.

LLM PC 7월 17일

인터랙션 기반 모델 설명

예측 모델링에서, 모델이 특정 목표 예측을 생성하는 이유를 설명하는 능력은 점점 더 중요해지게 되었다. [5, 10] 블랙박스 모델은 내부 메커니즘을 설명하는 투명한 설명을 제공하지 않기 때문에,แม้ว라 모델이 정확한 예측을 내도, 그 예측을 해석하고 검증하기는 어렵다. 중요한 상황에서, 예측 정확성만으로는 충분한 검증 매트릭스가 아니며, 모델의 결정에 대한 근거를 설명하지 못한다면, 더

LLM PC 7월 16일

인간 선호도와 설명을 통해 월드 모델을 이용한 안전한 Agent 행동 학습

안전한 환경에서-agent 정책을 교육하고 안전한 정책을 배포하는 문제를 해결하기 위해, 환경 동적이 알려지지 않고 적합한 보상 함수가 없을 때 문제를 다룹니다. 안전한 환경에서, 우리는 전통적인 강화 학습이 불실용적이라고 생각하고, 인간의 입력을 사용합니다. DROPJ라는 인간 중심의 방법을 제안하여 안전한 교육과 배포를 모두 처리합니다. 우선, 실제 세계의 이전 트래젝토리 데이터 세트에서

LLM PC 7월 13일

다층 퍼셉트론을 위한 격자 탐색을 통해 간격 인증

AI 안전성 문제 중 하나인 적대적 강도에 대한 이론적 framework을 제시한다. 적대적 강도 문제를 격자 탐색 문제로 줄이는 것을 보여준다. 격자의 각 요소는 입력 포인트 $\mathbf{x}$를 포함하는 축을 맞춰서 평행한 다차원 사각형(Interval)이다. 다층 퍼셉트론 분류기 (MLP)에서, Interval $I$는 $\mathbf{x} \in I$이며 $\mathbf{x}$가

LLM PC 7월 10일

offline 에이전트 정렬을 위한 이뭄레이션 학습을 위한 피드백 조작 규제

강화 학습(RL) 연구는 점점 더 인간 가치에 부합하는 행동을 배우도록 보장하는 동맹에 초점을 맞추고 있습니다. 인간의 시범과 피드백은 동맹에 중요했지만, 언어 생성에 대한 문맥적 밴디트 프레임을 위한 다단계 pipe라인을 주로结合하여 동맹을 위한 기존 접근법은 주로 인간의 시범과 피드백을结合합니다. 그러나 이러한 보완적인 입력들이 단일 단계 오프라인 학습을 위한 더 풍부하고 상호 연결된 신

LLM PC 7월 9일

컴팩트 월드 모델에 공간 관계를 기반으로 하여 지시 정보 누출과 목표가 없는 동역학 수정

구체적인 월드 모델이 언어 목표에 대해 조건화된 경우, '빨간 블록을蓝색 블록의 왼쪽에 놓다'와 같은 관계를 구체적인 '참조 앵커'를 사용하여 구체적인 세트로 표현할 수 있다고 약속합니다. 우리는 이러한 참조가 실제로 관계를 구축할 때 언제 발생하는지 물어보고, 다음의 함정에 부딪히게 됩니다: 목표 조건의 예측기가 놀랍도록 0.90의 관계 읽기 정확도를 달성하지만, 이는 '인스트럭션 전사'가

LLM PC 7월 9일

기업형 기관적 인공지능의 토큰 경제학을 설정하는 오케스트레이션 디자인 효과

현재 에이전트 AI 개발은 토큰을 최대화하는 방식으로 진행된다. 즉, 토큰을 사용하여 기능을 구매하는 방식으로, 더 긴 추론 경로, 더 많은 회전, 더 넓은 도구 로드, 더 큰 재생된_contexts를 얻기 위해 토큰당 작업의 가치가 증가하는 속도보다 토큰당 작업이 더 빠르게 증가한다. 토큰당 가격이 하락함에 따라 이 패턴은 드러나지 않지만, 총 지출은 여전히 증가한다. 우리는 토큰을 최대화

LLM PC 7월 8일

그래프에서 기울기까지: 물리적 지침에 의한 구조적 attribution을 위한 Cyber-Physical IoT 시스템과 그 이상

인공지능에서 설명 가능성 방법은 시스템이 특정 입력에 따라 어떤 방식으로 행동하는지의根本 원인과 그 영향력을 드러내어 더 깊은 이해를 가능하게합니다. 기존의 설명 가능성 방법과는 달리, 인과적 설명은 주로 입력 변수와 출력 변수 간의 상관관계만 강조하는 것에 초점을 맞추며, 대신에 intervene하는 질문에 초점을 맞추어 더 강력한 이해를 제공합니다. 이는 특히 고위험 영역에서 자동화된 결

LLM PC 7월 3일

유저 참여형 권한 관리 플랫폼인 Janus

AI 에이전트가 사용자의 대신에 도구 호출을 자동으로 수행하는 것은 사용자 권한 관리에 대한 심각한 문제를 제기한다. 사용자가 어떤 역할을 할 수 있고 어떤 역할을 해야 하는지에 대한 질문이다. 많은 제안된 방법이 있지만 사용자가 참여하는 에이전트 권한 관리의 역할은 여전히 미흡하다. 우리는 Janus 라는 사용자가 참여하는 에이전트 권한 관리 디자인을 구현하고 평가하는 놀이터 시스템을 소개

LLM PC 7월 3일

가능성 있는 행동 가능한 대체사유 설명을 위한 신경symbolic framework : PACE

counterfactual 설명은 머신 러닝 예측을 설명하기 위해 모델의 결정이 달라질 수 있는 최소한의 입력 변경을 식별하는 것입니다. 많은 기존 방법은 예측 변경을 생성하는 데 성공했지만 도메인 지식과 간섭 제약을 명시적으로 포함하는 기전이 부족하여 불현실적이거나 불가능한 추천을 생산하는 경향이 있습니다. 신경symbolic AI는 데이터 주도 예측 모델과 Symbolic 추론이 도메인

LLM PC 6월 30일

다중 모드 LLM의 이미지 기반 의료 대화에 대한 벤치마크

최근 대규모 언어 모델 및 시각-언어 모델의 발전으로 다중 모드 데이터에 대한 논리적 추론이 가능해졌고, 의료 적용 분야에서 의사결정 지원 및 전문의로의 분류와 같은 기회를 제공하고 있습니다. 그러나 현재 의료 AI 벤치마크는 분산되어 있습니다: 일부는 다중 턴 대화 지원을 제공하지만 이미지를 제공하지 못하고, 다른 벤치마크는 다중 모드 입력을 제공하지만 단일 턴 QA 작업에만 집중하고 있습

LLM PC 6월 29일

위험 정보: 계층적이고 설명 가능한 주장 확인 프레임워크를 위한 동적 다중 출처 증거 검색 및 집계

위험한 정보 환경에 대한 위협이 증가하고 있는 가짜 뉴스의 빠른 확산은 특히 GEO 중독(GEO poisoning)을 통해 adversarially 제작된 콘텐츠를 retrieval 시스템이 체계적으로 표면화할 수 있게 하면서 LLM 논리 reasoning을 오염시킵니다. 본 논문에서 우리는 Tree of Evidence (ToE), 가짜 뉴스 자동 확인 프레임워크를 제안하는데, ToE는 각

LLM PC 6월 26일

다중 모드 LLM 평가에서 놓치고 있는 것

대규모 다중 모드 언어 모델(Multimodal Large Language Model, MLLM)은 다양한 입력을 처리하고 텍스트 응답을 생성할 수 있다. 예를 들어, 텍스트, 이미지, 음성, 비디오 등이다. 이러한 모델의 기능은 급격히 발전하고 있지만 평가에는 그에 맞는 속도는 유지되지 않고 있다. 대부분의 기존 평가 기준은 단일 작업에만 제한되어 있으며, 모델이 모드 간 정보를 통합하는지

LLM PC 6월 16일

퀄컴의 최신 칩, 더 강력한 스마트 글래스가 곧 출시될 수 있음을 암시합니다.

스마트 글래스는 여전히 초창기 단계에 있지만, 칩 제조사인 퀄컴은 다음 XR 장치의 발전을 위해 실리콘을 업그레이드하고 있습니다: 스냅드래곤 리얼리티 엘리트. 퀄컴이 현재 Augmented World Expo에서 칩을 발표하고 있지만, 우리는 새로운 칩이 구동하는 장치를 […]에서 직접 사용해 보았습니다.

LLM PC 6월 16일

가정 가능한 자율 데이터 과학을 위한 증명 가능한 데이터 과학: 툴-기반 논리 reasoning을 통해 불규칙 TSQA 해결

실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대