본문으로 건너뛰기

검색

전체 기사

에이전트 4월 6일

그랜드코드: 컴퓨터 프로그래밍 경쟁에서 대마스터 수준 달성하기 위한 대인 강화 학습

컴퓨터 프로그래밍 경쟁에서 아직까지 AI가 인간을 능가하지 못하는 마지막 몇 가지 분야 중 하나입니다. 그 중 가장 최근의 결과, 구글의 Gemini~3 Deep Think은 8위에 오르지만 실시간 경쟁 조건 하에 평가되지 않았습니다. 이 연구에서 우리는 컴퓨터 프로그래밍 경쟁을 위한 대인 강화 학습 시스템인 그랜드코드를 소개합니다. 그랜드코드의 능력은 두 가지 주요 요인에 기인합니다: (1) 가정적인 모듈(가설 제안, 해결책, 테스트 생성, 요약 등)을 조정하고 그들을 공동으로 향상시키는 후 교육 및 실시간 테스트 시간 강화 학습; (2) 가정적인 GRPO를 소개합니다. 멀티 스테이지 에이전트 롤아웃에 지연된 보상을 위한 특수하게 설계되었습니다. 그랜드코드는 실시간 경쟁에서 인간 참가자들을 모두 능가하는 최초의 AI 시스템입니다. Codeforces의 최근 세 라운드(1087, 1088, 1089)에서 그랜드코드는 모두 1위를 차지했습니다.

에이전트 4월 6일

대화식 최적화 에이전트를 위한 설계 및 평가: LLM 에이전트를 이용한 인터랙티브 최적화

대화식 최적화 에이전트를 설계하고 평가하는 새로운 방법론을 제안했습니다. 이 방법론은 대규모 언어 모델(LLM)을 이용한 의사결정 에이전트를 역할을 하게 하여 다양한 이해관계자와의 대화를 통해 최적화 문제를 해결합니다. 결과적으로, 대화식 최적화 에이전트는 단일 동작 평가보다 훨씬 뛰어난 솔루션을 찾을 수 있었습니다.

AI 모델 4월 6일

OntoKG: 속성 그래프를 위한 개념 체계 기반 지식 그래프 구성

대규모 지식 그래프를 속성 그래프로 조직하는 데에는 구조적 결정이 필요합니다. 기존 접근법은 이러한 결정들을 파이프라인 코드에 임의로 추출하거나, 지식 그래프를 구성하는 과정과 밀접하게 결합된 스키마를 생성합니다. 우리는 개념 체계 기반 접근법을 제시합니다. 이 접근법은 스키마를 outset에서부터 ontology analysis, entity disambiguation, domain customization, LLM-guided extraction에 사용할 수 있도록 합니다. 핵심 메커니즘은 intrinsic-relational routing입니다. 이 메커니즘은 모든 속성을 intrinsic 또는 relational로 분류하고, 해당 스키마 모듈로 라우팅합니다. 이 라우팅은 스키마를 storage backends와 독립적으로 재사용할 수 있는 명령형 스키마를 생성합니다.