본문으로 건너뛰기

수행-제어 된 자기 압축: 교차 계열 게임 생성을 위한 버리파이어는 교육 프로그램이다.

AI 자동 생성

학습된 심사관을 이용해 코드 생성기를 후처리하면, 점수를 높일 수 있는 프록시 특성만 최적화할 수 있다. 우리는 반대 신호를 연구한다: 결정론적이고 심사관이 없는, 게임할 수 없는 필터 -- 생성된 프로젝트가 비정형 엔진에서 깨끗하게 실행되는지 여부(strict-launch). 이 게이트를 통과하면, 거짓 샘플링 자기 반영(compound out-of-family generalization) 효과가 나타난다. GameCraft-Bench (natural-language brief를 Godot 프로젝트로 매핑)에서, 14B 모델(Qwen3-14B+LoRA)가 strict-launch에서 distill된 결과, 4개의 보이지 않는 게임 패밀리에서 per-candidate로 clean generation이 8.8%에서 42.2%로, best-of-K coverage가 18/25에서 25/25(gold ceiling)로 증가했다. 이 증가는 단순히 데이터를 추가한 것만이 아니다: gold-duplication control(gold-duplication과 정확히 매칭된 것)에서는 base model보다 낮아진다(5.6% vs. 8.8%, p=0.019), count-matched decomposition(quantify된 decomposition)은 round-1-to-2 jump를 quality(+8.8pp)와 quantity(+8.5pp)로 분할한다. 가장 직접적으로는, filter만 바꾼 경우 -- lenient BUILD check(99.9%의 생성이 통과한다) -- gain을 완전히 제거한다(base model과 동일, p=1e-3 vs. launch-gated round), verifier precision을 optimizer보다 우선시한다. 두 번째 ungameable 신호, headless execution grounding, round를 거치며 monotonically 증가하고, gold-duplication과 동일한 비용에서 far 더 grounded 후보를 제공한다(16 vs. 5), gain이 기능적이기보다는 launch-but-empty가 아니라는 것을 확인한다. 게임 생성은 하나의 교훈을 위한 검증 가능한 시험대다: 심사관은 교육 과정이다 -- 심사관이 인증하는 것은 모델이 배운 것이다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.