본문으로 건너뛰기

검색

전체 기사

LLM PC 6월 16일

가정 가능한 자율 데이터 과학을 위한 증명 가능한 데이터 과학: 툴-기반 논리 reasoning을 통해 불규칙 TSQA 해결

실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대

AI 모델 6월 16일

Riemann 가설 근접 증명: 경계 증명서, 검증 가능한 유한 라가리아 불등식 및 명시적 실패 지역화

Riemann 가설은 수학의 중추적 미해결 문제 중 하나입니다. 이 기사에서는 AI-assisted 증명 시스템을 사용하여 Riemann 가설에 대한 부분 증명을 생성하고, 명시적으로 남아있는 수학적 장벽을 식별하는 것을 목표로 합니다. 본 연구에서는 Verifiable Growing Physical Transformer with Recursive Self-Improvement(VGPT-RSI)를 사용하여 Riemann 가설 근접 증명서를 생성하고, 유한 라가리아 불등식에 대한 증명서를 생성하는 두 가지 RH-접근 증명 작업을 수행합니다.

에이전트 6월 16일

위험 인식 기반 LLM agent를 위한 지리 공간 데이터 검색: 설계 및 초기 적대 평가

우리는 cloud-based 지리 공간 카탈로그에서 자연어 쿼리 사용하여遠距離 센싱 데이터를 검색하는 LLM 구동 프레임워크를 제시합니다. 시스템은 사용자의 의도를 구조화된 API 호출로 변환하여卫星 사진과 환경 데이터에 효율적인 접근을 허용합니다. 아키텍처는 세 가지 agent를 통합합니다: 안전성과 정책 집행을 위한 Guardrail, 의도 해석을 위한 General-QA, schema-

AI 모델 6월 16일

모델링에서 시간까지 고려하는 이벤트 모델링을 위한 크로스 모달 표현 대응

accurate 시간까지 발생하는 예측(TTE)은 멀티모달 클리닉 데이터에서 어려움을 겪고 있습니다. 이는 모달 불균형과 분포 shift로 인해 발생합니다. 우리는 CT 영상과 연속적인 EHR 데이터 사이의 모달 대응을 위한 foundation model-기반 프레임워크를 제안합니다. 이 프레임워크는 여러 작업과 기관에서 일반화가 가능합니다. CT와 EHR 모달리티는 각각 domain-spe

에이전트 6월 16일

컴퓨터 사용 에이전트의 안전성 평가를 위한 벤치마크

컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용

AI 모델 6월 16일

메트릭 매치: LLM 심판 신뢰도 평가를 위한 서브셋 선택 접근법

LLM 판독기(LLM judges)는 오픈 엔드 텍스트 생성(open-ended text generation)을 평가하는 데 드는 비용이 많이 드는 인간 노동의 필요성을 줄이기 위해 사용됩니다. 그러나 이러한 판독기의 신뢰도는 인간 평가자와의 일치(property)가 결정하는데, 그 자체도 비용이 많이 드는 인간 주석(annotation)에 의존합니다. 이 연구에서는 제한된 주석(annota

AI 모델 6월 16일

인공 지능의 기억 추적: 생물학적 기억 단위와 인공 지능의 기억

인공 지능은 생물학적 기억과 유사한 identifiable 기억 추적을 보유하는지 여부가 여전히 열린 문제입니다. 본 연구에서는 기하학적 프레임워크를 통해 AI engram을 식별하고, 생물학적 기억의 특성인 명확성, 재활성화, 충분성, 필요성 등을 포함한 제한된 역역 문제를 formalize했습니다. 본 연구는 대규모 언어 모델(LLM) 등 다양한 실험을 통해 AI engram의 유의미성과 대규모 확장성을 입증했습니다.

연구 6월 16일

의미강화된 검색 보강 시계열 예측

시계열 예측 모델은 역사적인 패턴에서 많은 이점을 얻습니다. Retrieve-Augmented Generation(RAG)에서 영감을 받아 최근 연구에서는 시계열 예측을 향상시키기 위해 관련된 역사적인 시계열 구간을 검색하는 것을 탐구했습니다. 그러나 비stationarity 하에서만 시계열 유사성을 단지 의존하는 것은 종종 충분하지 않습니다. 이를 해결하기 위해 우리는 멀티모달 접근을 제안

에이전트 6월 16일

LLM agent에 대한 표준화된 Prolog 도구 인터페이스: PrologMCP

프론티어(_frontier) 논리 reasoning-tuned 언어 모델은 깊은 deductive 작업에서 실패하고, 내부 reasoning을 확장하여 성능을 개선하는 비용은 좋지 않다. Symbolic delegation은 논리 프로그래밍의 자동 formalization pipe line을 통해 문제를 번역하고, 해결기를 통해 추론을 수행하는 보완적인 경로를 제공한다. 그러나 현재 논리 프