본문으로 건너뛰기
AI 모델 22시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

AI 모델 2일 전

표면적인 디자인 너머: 사용자 시뮬레이터를 행동 일관성과 일치시키기

인터랙티브 인공지능(Interactive AI)을 대규모로 개발하고 평가하며 개선하는 데는 충실한 사용자 시뮬레이션(faithful user simulation)이 필수적입니다. 그러나 합리적인 개인적인 응답(plausible individual responses)이 실제 상호 작용에서 관찰되는 의도 진화(intent evolution)와 결과물(outcomes)을 재현하는 것은 보장하지 못

AI 모델 2일 전

세계 모델에서 물체 지속성 훈련

인간의 인지 전제 중 물체의 영구성(permanence)과 단단함(solidity)은 물리적 지능을 발전시키는데 큰 영향을 미칩니다. 최근 연구 결과, 비디오 생성 모델이 인간과 같은 논리적 추론 능력을 발전시키고 있는 것으로 나타났습니다. 비디오 모델이 물체의 영구성을 지닌다고 말할 수 있을까요? 그렇지 않다면, 인지 전제에 기반한 데이터셋을 통해 모델을 훈련할 수 있을까요? 우리는 WRO

AI 모델 2일 전

대화 기억의 Intervention 품질에 대한 제안된 Bench-mark인 TWIST: 인간이 검증한 Draft-Alignement

arXiv:2609.28575v1 발표 형식: 새로운 발표 요약: 장기 대화 메모리 벤치마크는 최근 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트 recall을 점점 더 테스트합니다. TWIST는 deployed 메모리 시스템의 intervention quality, 즉 belief change 지점에서 c

AI 모델 2일 전

듀얼 엔트로피 강화 정책 최적화: MLLMs에서 환상 생성을 위한

강화 학습(RL)은 멀티모달 대규모 언어 모델(LLLM)의 추론을 더 명확하게 만들기 위해 널리 사용되지만, 오류의 위험성이 가장 높은 곳에서 오류가 발생하는 것을 방지하는 효과는 균일하지 않다. 이는 보상에서 매개변수 업데이트로의 수정 chain에서 두 개의 약점으로 인한 것이다. rollout 단계에서, 의미론적 엔트로ピー가 높은-hard 쿼리---그것들은 단결적으로 잘못된 샘플 그룹을

AI 모델 2일 전

구글의 인공지능이 얼굴을 얻은 라이브 아바타와 함께 지니미 3.8 라이브

구글의 새로운 지미니(Gemini) 3.8 라이브 업데이트(Live update)가 사용자들이 대화하는 동안 애니메이션 AI 인물이 실시간으로 반응하는 것을 볼 수 있게 해준다. '라이브 아바타'(Live Avatar)는 입술 동기화 및 다양한 얼굴 표정 표현을 통해 대화에 참여할 수 있지만, 현재는 지미니 엔터프라이즈(Gemini Enterprise) 고객에게만 제공된다. 구글에 따르면 라

AI 모델 2일 전

구름이 이제 전화 대기 시간을 줄여주는 사업체 전화 서비스를 제공합니다.

구글(Google)은 픽셀 11(Pixel 11)에서 "초기 실험" 기능을 출시했습니다. 이 기능은 사용자가 지미니(Gemini)에게 지역 업체 호출을 위임할 수 있게 해줍니다. 예를 들어 예약을 하거나 제품의 재고를 확인하거나 예약을 다시 조정할 수 있습니다. 구글(Google)에 따르면, 사용자가 지미니(Gemini)가 호출을 처리하도록 하려면 호출을 시작할 필요도 없습니다: 대신에, 자

AI 모델 3일 전

유니버설 오모드 임베딩의 경계를 확장하는 오비스 임베딩

이 연구에서는 **Ovis-Embedding**이라고 부르는 cutting-edge의 모든 모드(omni-modal) 임베딩 패밀리를 소개합니다. 이 임베딩은 텍스트, 이미지, 비디오, 오디오를 포함하는 원시 통합에 기반합니다. 기존의 임베딩은 각 모드별로 별개의 모드 탑(tower)을 구성하는 대신, Ovis-Embedding은 공통된 다모드 백본(backbone)을 사용하여 다중 모드 데

AI 모델 3일 전

GBM 생존 예측을 위한 정확하고 해석 가능한 하이퍼 그래프 신경망

GBM의 생존 예측은 정확하고 해석 가능한 모델을 요구하지만 현재의 접근법은 이 두 가지 목표를 경쟁적으로 다루고, 성능이 좋은 모델은 투명성을 포기하고, 해석 가능한 모델은 예측 능력을 희생한다. 우리는 이 트레이드 오프가 본질적인 것은 아니라고 주장한다. 그래프 신경망은 구조적 기초를 제공하여 해석 가능한, 설명 가능한 표현을 추출할 수 있다. 또한 현재의 방법은 일반적으로 단일 이미지

AI 모델 3일 전

4DGS-JEPA: 동적 가우시안 스팟팅을 위한 시간적으로 합성 가능한 공동 임베딩 예측

arXiv:2609.25036v1의 abstract를 한국어로 번역해 드리겠습니다. 다이나믹 가우시안 스팟팅(Dynamic Gaussian Splatting)은 3D 장면이 변화하는 과정을 명시적으로 표현하는 방법을 제공하지만, 기존의 접근법은 주로 재구성, 미래 상태 생성, 렌더링을 위해 최적화된 반면에 재사용 가능한 예측 동적을 학습하는 데에는 최적화되지 않았다. 우리는 4DGS-JEPA

AI 모델 3일 전

합성인물이 실제 시청자 반응을 예측할 수 있을까? 합성인물 기반 복제를 이길 수 있는 No-Persona 기준점을 가진 시뮬레이션 연구

마케터들은 점점 더 대규모 언어 모델(LLM)을 "합성적 인물"로 사용하여 복사본이 배포되기 전에 청중이 복사본에 어떤 반응을 할지 예측하는 데 사용한다. 이에 대한 동기 부여는 프로파일 조건付け된 LLM이 인간 샘플을 모방한다는 증거로 인해 이뤄진다. 하지만 실제 행동에 대한 그 예측은 실제로 유효한가 - 그리고 인물 기계는 도움이 되는가? 우리는 Upworthy 연구 아카이브 - 수천 개

AI 모델 3일 전

이번 여름의 인공지능 만신창이 속이지 마세요

지난 달들 사이에 AI에 대한 열정은 절정에 달했다. 4월 말에 Anthropic은 모델 Claude Mythos가 보안 전문가들보다 소프트웨어 취약점을 찾는 데 더 뛰어난 성과를 냈다고 주장했다. 그 뒤를 이어 OpenAI와 Hugging Face 사이의 해킹 사고가 발생했고, 그 뒤를 이어 Anthropic과 Meta는 각자 모델과 관련된 유사한 사건을 공개했다. 그 사건은...