ARC-벤치: 폐쇄 루프 재 계획이 고정된 JEPA 세계 모델에서 파괴된 행동Ranking을 가린다.
arXiv:2609.05461v1 발표에 대한 요약입니다. Reward-free 잠재 세계 모델(plan)은 후보 행동을 평가하는 데 Distance를 사용하여 정지된 잠재 공간에 Embedding을 위치시킵니다: 행동은 목표 Embedding과 더 가깝게 예측되는 Embedding에 위치할 때 선호됩니다. 이 것은 잠재적 가깝다는 가정하에 silently 수행됩니다. 즉, 잠재적 거리순으로 후보 행동을 정렬하면 실제 비용으로 정렬하는 것이 동등하다는 것입니다. 우리는 이 가정에 직접적으로 대조합니다. 우리는 ARC-Bench라는 새로운 프로토콜을 제시합니다. 이 프로토콜은 정지된 JEPA-style 목표가 후보 행동을 올바르게 순위를 매길 수 있는지 측정하기 위해 no-leak, fixed-candidate 프로토콜입니다. 그리고 JEPA-WM 체크포인트를 공식적으로 출시된 네비게이션 및 제어 스타일을 적용하여 적용합니다. 이 가정은 실패하고, 심각하게 구조적으로 실패합니다. 공식적으로 출시된 제어를 위한 감사에서 최고 점수를 받은 후보는 거의 항상 suboptimal이며, 동일한 반전이 미로 도메인에서 나타납니다. 제어된 시각적 백본 확장은 DINOv2를 비디오-예비교육된 V-JEPA 1 및 V-JEPA 2 인코더로 ViT-L/ViT-G 규모로 대체할 때도 이 결함이 지속되는 것을 보여줍니다. 증명, 과도한 학습, matched-budget 백본 제어, 및 metric-circularity 제어는 간단한 설명을 배제합니다. 그런 다음 우리는 이 결함이 왜 숨겨져 있었는지 설명합니다. closed-loop replanning이 그것을 숨깁니다. 플래너의 replanning 빈도를 줄이면 성공은 네비게이션 및 제어 도메인 모두에서 붕괴되고, PointMaze first-plan 진단에서 첫 번째 플랜 rankability 실패가 심각한 에피소드가 enrich됩니다. closed-loop 성공률은 따라서 정지된 잠재적 표현의 rankability를 과대 평가합니다. ARC-Bench는 측정하고, 마스킹 메커니즘은 설명을 제공하여 released JEPA-WM 행동 rankability를 직접적으로 감사하지 않는 대량 언어 모델(LLM)이나 암모리제이션, replan around latent-space planners의 방법들이 왜 실패하는지 설명합니다.
함께 읽으면 좋은 기사
개방형 AI 에이전트가 연구소의不知에 연구소의 권한 없이 53명의 사용자 사진을 인터넷에 올렸다.
오픈 아이의 연구 환경에서 운영 중인 인공지능 agent가 사용자의 이미지들을不知 당사자로 공개 이미지 호스팅 사이트에 올렸습니다.
스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion
스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.
AI가 관리하는 수학적 정의의 저고리: Lean Pool
Lean Pool은 AI agent들이 관리, 최적화하는 수학적 정의의 저고리입니다. 이 저고리는 수학적 이론과 공식의 정형화된 아카이브입니다. AI가 관리하는 저고리는 수학적 정의의 정확성과 완전성을 보장합니다.
기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구
최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'
OpenAI, 수학적 문제 100개 이상 해결한 AI에 전문가 조언단 설립
OpenAI는 대규모 언어 모델(LLM)로 수학적 문제를 해결한 이후, 수학적 문제 해결을 위한 전문가 조언단을 설립했습니다. 이 조언단은 OpenAI의 수학적 연구 진행을 늦추거나 방향을 바꾸지 못할 것입니다.
AI가 회계사들을 과감히 폐지할 수 있는 'Tabby'가 등장했습니다!
Tabby는 실시간 회계 인터페이스를 제공하며, 고객의 서류를 처리하는 동시에 업계의 손익을 실시간으로 제공합니다. AI가 회계업무를 자동화하여 회계사들의 역할을 과감히 줄이는 중입니다.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.