본문으로 건너뛰기

마스크된 확산 언어 모델에 대한 컴퓨팅 지식에 의한 재마스킹 평가 프로토콜

AI 자동 생성

.masked diffusion 언어 모델(Masked diffusion language models, MDLMs)은 빠르게 발전하고 있지만, 그들의 진전을 신뢰할 수 있는 평가 기준은 따라가지 못하고 있습니다. MDLMs가 자율적인 언어 모델과 경쟁할 수 있게 된 것은 물론, 최근 7개의 remasking 논문은 상응하는 설정 하에 평가를 수행하지 않고, 명목상 단계 수, 지표, 및 샘플링 온도에 대한 변화를 무시한 채로 각 전략의 순위를 결정했습니다. 이로 인해 각 전략의 순위를 비교하는 것은 어려워졌으며, 보고된 이익이 알고리즘 개선인지 평가 오류인지 여부를 밝히지 못했습니다. 우리는 CaRE, compute-aware 평가 framework를 제시합니다. CaRE는 MDLM remasking 전략을 검토하기 위해 실제 함수 평가 횟수(actual number of function evaluations, NFE)를 표준화하고, 다중 지표 보고를 강제하고, 확률성을 명시적으로 제어합니다. CaRE는 LLaDA-8B-Base와 Dream-7B-Base를 4개의 확률성 수준과 3개의 단계 지출에 대해 OpenWebText와 LM1B에서 7개의 remasking 전략을 테스트했습니다. CaRE는 다음과 같은 결과를 나타냅니다: (i) 온도는 MAUVE 변화를 설명한다, (ii) compute-matched 비교는 여러 개의 발표된 전략 순위를 역전시켰으며, (iii) informed remasking과 stochastic unmasking은 상호 배타적이며, high-entropy remasking은 unmask_temp=0.25에서 256 단계에서 MAUVE를 0.296 감소시켰다(p=0.020). CaRE leaderboard는 12개 open-weight MDLM(150M에서 8B 파라미터)를 포함하여, 이 상호 작용 방향이 아키텍처와 크기와 상관없이 유지됩니다. 이 결과는 현재 MDLM 평가가 알고리즘 개선을 감추어진 컴퓨팅 및 확률성의 선택과 혼동하는 경향이 있음을 보여줍니다. 우리는 평가 프로토콜, implementation, 및 leaderboard를 공개하여 향후 remasking 선언이 재현되고 비교할 수 있도록 합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

연구 6일 전

SAS 비전 트랜스폼러에 기반한 강화된 대비 학습

아티클 번호: 2609.21061v1 발표 유형: 새로운 개요: 합성 어레이 소나(SAS)를 사용하는 자동 목표 식별(AUTR)은 고급 해군 기능을 지원하지만, 깊은 학습은 희소한 목표 이미지를, 배경 잡음 및 인간의 평가를 제한한다. 우리는 바다 속 SAS AUTR을 위한 DINOv3 비전 트랜스포머(ViT) 모델을 3단계의 매개 변수 효율적인 프레임워크로 적응시킨다. 단계 1은 ViT 백

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.