본문으로 건너뛰기

#arXiv

1177개의 기사

AI 모델 2일 전

표면적인 디자인 너머: 사용자 시뮬레이터를 행동 일관성과 일치시키기

인터랙티브 인공지능(Interactive AI)을 대규모로 개발하고 평가하며 개선하는 데는 충실한 사용자 시뮬레이션(faithful user simulation)이 필수적입니다. 그러나 합리적인 개인적인 응답(plausible individual responses)이 실제 상호 작용에서 관찰되는 의도 진화(intent evolution)와 결과물(outcomes)을 재현하는 것은 보장하지 못

AI 모델 2일 전

세계 모델에서 물체 지속성 훈련

인간의 인지 전제 중 물체의 영구성(permanence)과 단단함(solidity)은 물리적 지능을 발전시키는데 큰 영향을 미칩니다. 최근 연구 결과, 비디오 생성 모델이 인간과 같은 논리적 추론 능력을 발전시키고 있는 것으로 나타났습니다. 비디오 모델이 물체의 영구성을 지닌다고 말할 수 있을까요? 그렇지 않다면, 인지 전제에 기반한 데이터셋을 통해 모델을 훈련할 수 있을까요? 우리는 WRO

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

AI 모델 2일 전

대화 기억의 Intervention 품질에 대한 제안된 Bench-mark인 TWIST: 인간이 검증한 Draft-Alignement

arXiv:2609.28575v1 발표 형식: 새로운 발표 요약: 장기 대화 메모리 벤치마크는 최근 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트 recall을 점점 더 테스트합니다. TWIST는 deployed 메모리 시스템의 intervention quality, 즉 belief change 지점에서 c

AI 모델 2일 전

듀얼 엔트로피 강화 정책 최적화: MLLMs에서 환상 생성을 위한

강화 학습(RL)은 멀티모달 대규모 언어 모델(LLLM)의 추론을 더 명확하게 만들기 위해 널리 사용되지만, 오류의 위험성이 가장 높은 곳에서 오류가 발생하는 것을 방지하는 효과는 균일하지 않다. 이는 보상에서 매개변수 업데이트로의 수정 chain에서 두 개의 약점으로 인한 것이다. rollout 단계에서, 의미론적 엔트로ピー가 높은-hard 쿼리---그것들은 단결적으로 잘못된 샘플 그룹을

에이전트 2일 전

정책 기반 의사 결정 세계 시뮬레이션

arXiv:2609.28547v1 발표 유형: 새로운 abstract 정책 개입은 공공 커뮤니케이션, 기관 결정, 이해 당사자 반응을 통해 전파되나, 금융 다중 agent 시뮬레이션의 데이터셋은 시간적으로 일치하는 역사적 증거와 이러한 프로세스를 연결하는 것을 거의 하지 않는다. 우리는 PAWS, 정책 주도적인 인격체 월드 시뮬레이션 데이터셋을 소개한다. 이는 36개의 미국 금융 및 경제 정

에이전트 2일 전

TW3Cast: 얼음처럼 고정된 라우터의 약간 조정된 기반 모델을 사용한 GIFT-Eval에 대한 시계열 예측을 위한 훈련 분할에 따라 전적으로 선택된 것

TW3Cast는 현재 2026년 9월 14일 기준 GIFT-Eval 벤치마크에서 평균 MASE rank 3위에 오른 시계열 예측 시스템입니다. TW3Cast는 agent나 대규모 언어 모델(LLM)을 사용하는 멀티 스텝 시스템이 포함된 리더보드 상위 두 개의 항목을 제외하고는 agent나 대규모 언어 모델(LLM)을 사용하지 않습니다. TW3Cast는 훈련 분할에서 한 번만 계산된 표를 사용

에이전트 2일 전

예측 요인들이 언제 합리화해야 하는가? 신뢰성 경로에 대한 행동적 부하 테스트

예측 모델은 점점 더 언어 모델 reasoning, retrieval, ensembling, 및 calibration을 결합하지만, 각 행동을 어느 시점에 신뢰해야 하는지 여전히 불분명하다. ForecastBench-style 이진 예측 작업에서 이 질문을 연구했으며, 데이터를 가져오기, reasoning, market prior에 따르기, 또는 역사적 analog을 사용하기를 observa

에이전트 3일 전

LLM agent가 방을 읽지 못할 때: 관계적 사회적 사고를 위한 ReAdapt

사회적 대상을 위한 기본적인 결정들(이 게시물을 반응해야 할까? 누구에게 연락해야 할까?)은純粹한 콘텐츠 문제가 아니다. 올바른 행동은 사람들 사이의 잠재적 관계에 따라 결정되는데, 그것은 연결의 강도, 상호 연결성, 상호 연결성에 의존한다. 대규모 언어 모델(LLM) agent 루프들은 표면적인 관계와 콘텐츠의 힌트가 다르면 새로운 관계적 증거가 agent의 현재 사회적 가설을 수정해야 하

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

에이전트 3일 전

AI 신경과학자: 신경영상 분석을 위한 인터랙티브 에이전트 인터페이스

신경영상 데이터 분석을 위한 전문적인 프로그래밍과 통계적 지식이 필요하여 연구자들이 컴퓨팅 배경을 갖지 않아도 분석할 수 있는 방법이 제한되어 있다. 우리는 AI Neuroscientist라는 언어 agent를 제시한다. 이 시스템은 대규모 언어 모델(LLM)과 신경영상 도구를 통합하여 데이터의 품질을 확인하고 모델링 및 시각화를 수행할 수 있다. 이로 인해 연구자들은 자연어로 데이터의 품질

AI 모델 3일 전

유니버설 오모드 임베딩의 경계를 확장하는 오비스 임베딩

이 연구에서는 **Ovis-Embedding**이라고 부르는 cutting-edge의 모든 모드(omni-modal) 임베딩 패밀리를 소개합니다. 이 임베딩은 텍스트, 이미지, 비디오, 오디오를 포함하는 원시 통합에 기반합니다. 기존의 임베딩은 각 모드별로 별개의 모드 탑(tower)을 구성하는 대신, Ovis-Embedding은 공통된 다모드 백본(backbone)을 사용하여 다중 모드 데

AI 모델 3일 전

GBM 생존 예측을 위한 정확하고 해석 가능한 하이퍼 그래프 신경망

GBM의 생존 예측은 정확하고 해석 가능한 모델을 요구하지만 현재의 접근법은 이 두 가지 목표를 경쟁적으로 다루고, 성능이 좋은 모델은 투명성을 포기하고, 해석 가능한 모델은 예측 능력을 희생한다. 우리는 이 트레이드 오프가 본질적인 것은 아니라고 주장한다. 그래프 신경망은 구조적 기초를 제공하여 해석 가능한, 설명 가능한 표현을 추출할 수 있다. 또한 현재의 방법은 일반적으로 단일 이미지

AI 모델 3일 전

4DGS-JEPA: 동적 가우시안 스팟팅을 위한 시간적으로 합성 가능한 공동 임베딩 예측

arXiv:2609.25036v1의 abstract를 한국어로 번역해 드리겠습니다. 다이나믹 가우시안 스팟팅(Dynamic Gaussian Splatting)은 3D 장면이 변화하는 과정을 명시적으로 표현하는 방법을 제공하지만, 기존의 접근법은 주로 재구성, 미래 상태 생성, 렌더링을 위해 최적화된 반면에 재사용 가능한 예측 동적을 학습하는 데에는 최적화되지 않았다. 우리는 4DGS-JEPA

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

AI 모델 3일 전

합성인물이 실제 시청자 반응을 예측할 수 있을까? 합성인물 기반 복제를 이길 수 있는 No-Persona 기준점을 가진 시뮬레이션 연구

마케터들은 점점 더 대규모 언어 모델(LLM)을 "합성적 인물"로 사용하여 복사본이 배포되기 전에 청중이 복사본에 어떤 반응을 할지 예측하는 데 사용한다. 이에 대한 동기 부여는 프로파일 조건付け된 LLM이 인간 샘플을 모방한다는 증거로 인해 이뤄진다. 하지만 실제 행동에 대한 그 예측은 실제로 유효한가 - 그리고 인물 기계는 도움이 되는가? 우리는 Upworthy 연구 아카이브 - 수천 개

AI 모델 4일 전

호스팅 LLM에서 지속성 없이 복제: 측정 민감성의 행동-시간 신뢰도 평가

호스트 언어 모델의 행동 평가 결과가 달라질 수 있는 이유는 평가되는 서비스, 측정 도구, 또는 두 가지 모두가 실행될 때마다 다를 수 있기 때문이다. 우리는 다음 세 가지 검증 질문을 분리한다: 이전에 발견된 결과가 역사적인 구성에서 새로운 데이터에서 반복되는지 여부 (반복), 평가와 추론 구성이 동일한 식별자에서 다시 빌드될 때 종점이 바뀌는지 여부 (측정 민감도), 동일한 측정 도구에서

인기 태그