본문으로 건너뛰기

검색

전체 기사

AI 모델 9월 12일

학습이 중단되는 유효성 검사를 통해 본 갱신 승인: 강인한 에이전트의 지속적인 학습 auditing

갱신 승인은 유용한 지속적인 학습을 막을 수 있는 유해한 정책 갱신을 거부하는 데에도 필요합니다. 우리는 업데이트 승인을 에러 제어와 일정한 상호 작용 비용 내에서 유지되는 학습 기회를 평가해야 함을 주장합니다. 우리는 구체적인 실패를 식별했습니다: 범위 기반 신뢰 게이트는 상당한 비용 내에서 이전 작업의 변하지 않은 행동을 인증하지 못합니다. paired-binomial 구성은 결과 불일치가 드물면 이 부담을 줄여줍니다. 우리는 또한 인증된 역사적 참조 승진과 라운드 레벨 미스 기회 지표를 명시했습니다.

에이전트 9월 12일

과목 없이 공부하는 것: 작업에 독립적인 환경 전처리

대규모 언어 모델(LLM) agent가 새로운 환경에서 작업을 수행하기 전에, 사용 가능한 자료집과 도구를 검사하고 재사용 가능한 리소스인 인덱스, 스크립트, 절차적 지침을 생성할 수 있다. 대부분의 자동 적응 방법은 however, however task 예시, 트래제키트, 또는 평가 feedback를 사용하여 어떤 것을 만들지 결정한다. 그러나 existing task-agnostic 방

AI 모델 9월 12일

임의성이 있는 의료 언어 모델에 대한 결정론적인 수학 풀이 도구 개발을 위한 방향

대규모 언어 모델은 산술 연산에서 불신할만큼 불신할 정도로 불안정하다. 이는 임상 계산기에서 단 하나의 숫자 오류가 권장 사항을 바꾸는 문제를 일으킨다. 표준적인 해결책은 각 계산기를 한 번씩 검증된 함수로 하드 코딩하는 것이다. 우리는 다른 대안을 시험해보았다. 모델은 산술 연산을 하지 않고, 대신에 사례별로 Python 코드를 작성하고, 제한된 지역 실행자로 실행되는 결정론적 해결책으로

에이전트 9월 12일

작업을 마무리하는 것만큼 충분하지 않다: 평가하는 agent의 내구성과 고려 깊은 참여를 위한 축적된 도전

generative AI agent를 장기적으로 배치할 때 단일 작업의 성공만큼은 아니야. agent는 반복적인 상호 작용, 변화하는 조건, 사람들에 대한 의존성, 공유 워크플로우에서 특히 기술적, 인간적, 운영적 방해가 시간에 따라 쌓여가면서 유용하게 유지해야 해. 우리는 운영성과 배려 참여를 평가하는 agent의 두 개의 보완적인 측면을 제안한다: former는 agent가 작업이 막히면

AI 모델 9월 12일

IMO 금메달을 위한 열린 레시피: 올림피아드 수학을 위한 Nemotron 훈련

arXiv:2609.10712v1 발표 유형: 새로운 abstract: 우리는 hard olympiad 수학을 위한 자연어 증명 생성에 대한 모델 포스트-트레이닝 및 테스트-타임 추론 디자인의 영향을 연구합니다. Nemotron 3 Ultra에서부터, 우리는 지도 학습 및 강화 학습을 사용하여 두 가지 전문가 체크포인트를 훈련하고 체크포인트 선택, 검증 및 개선 평가를 수행합니다. 이러한 결

AI 모델 9월 12일

기억화-일반화 전환의 양적화: 스케일링 법칙과 Grokking의 상분리 구조

인공신경망이 기억화 이후 일반화에 대한 지연된 전환을 겪는다는 '그로킹' 현상은, 이 현상의 발생 이유에 대한 이론적 진전에도 불구하고, 하이퍼 매개 변수 공간에서 이 현상이 언제 발생하는지에 대한 양적 구조는 아직 규명되지 않았다. 우리는 모듈러 산술에서 2중-layer MLP 384개 구성의 기억화-일반화 경계를 매핑하고, 일반화 시작 시간에 대한 기하급수 계열 관계를 적합하여, $T_{

연구 9월 12일

규칙 chaining 프레임워크: 합성적이고 해석 가능한 인공지능 추론

인공지능 추론의 새로운 프레임워크가 개발되었습니다. 이 프레임워크는 기하학적, 색상, 물체 기반 분석을 통해 원자적 변환을 유도하고, 블록 병합, 반복, 공간적 힌트를 사용하여 출력을 재구성하는 세 가지 보완적인 솔버를 통합합니다. 이 프레임워크는 인공지능 추론을 합성적이고 해석 가능한 방식으로 향상시킬 수 있습니다.

에이전트 9월 12일

자연어 설명으로부터 QUBO 형식 자동 생성: AI 기술의 새로운 획기적 발전

콤비네이터리 최적화 문제를 해결하기 위한 QUBO 형식 자동 생성이 가능해졌습니다. 이 기술은 자연어 설명을 분석하여 QUBO 형식을 자동 생성할 수 있는 멀티 에이전트 프레임워크를 개발하였습니다. 이 프레임워크는 68%의 정확도를 달성하였으며, 이전의 단일 호출 기반 baseline보다 22% 더 높은 정확도를 달성했습니다.