본문으로 건너뛰기

#Gemini

130개의 기사

에이전트 4월 6일

그랜드코드: 컴퓨터 프로그래밍 경쟁에서 대마스터 수준 달성하기 위한 대인 강화 학습

컴퓨터 프로그래밍 경쟁에서 아직까지 AI가 인간을 능가하지 못하는 마지막 몇 가지 분야 중 하나입니다. 그 중 가장 최근의 결과, 구글의 Gemini~3 Deep Think은 8위에 오르지만 실시간 경쟁 조건 하에 평가되지 않았습니다. 이 연구에서 우리는 컴퓨터 프로그래밍 경쟁을 위한 대인 강화 학습 시스템인 그랜드코드를 소개합니다. 그랜드코드의 능력은 두 가지 주요 요인에 기인합니다: (1) 가정적인 모듈(가설 제안, 해결책, 테스트 생성, 요약 등)을 조정하고 그들을 공동으로 향상시키는 후 교육 및 실시간 테스트 시간 강화 학습; (2) 가정적인 GRPO를 소개합니다. 멀티 스테이지 에이전트 롤아웃에 지연된 보상을 위한 특수하게 설계되었습니다. 그랜드코드는 실시간 경쟁에서 인간 참가자들을 모두 능가하는 최초의 AI 시스템입니다. Codeforces의 최근 세 라운드(1087, 1088, 1089)에서 그랜드코드는 모두 1위를 차지했습니다.

인기 태그