권익이 있는 지침이 맞지 않을 때: 상태가 일치하는 라우팅과 멀티 턴 에이전트의 맥락화 된 자기 분출
온라인 환경에서 다단계 agent를 학습시키기 위한 privileged on-policy distillation은 teacher가 student의 각 단계마다 training-only reference를 사용하여 response를 재점검할 수 있도록 해줍니다. 그러나 student의 이전 동작은 실행 상태를 계속해서 변경합니다. student가 다른 동작을 취하거나 subgoal을 다른 순서로 완료하면 rollout은 reference에 의해 커버되지 않는 상태에 도달할 수 있습니다. 따라서 reference는 실제로 도달한 상태에 대한 신뢰할 수 있는 안내원으로 작용하지 않습니다. 따라서 privileged distillation을 무차별적으로 적용하면 state-reference mismatch가 발생합니다. 이 불일치는 student의 현재 실행 상태와 호환되는 privileged reference guidance를 제공하는 central objective를 유도합니다. 우리는 State-Matched Routing and Contextualized Self-Distillation (SMRC-SD)을 제안합니다. SMRC-SD는 teacher가 student의 현재 실행 상태가 reference 트레일로의 어느 supported state와 일치하는지 명시적으로 확인합니다. distillation은 일치하는 상태에서만 적용되며, reference가 locally compatible guidance를 제공하지 못하는 경우에는 해당 턴을 필터링합니다. 일치하는 각 상태마다, SMRC-SD는 state-conditioned teacher context를 생성하여 supervision을 실제로 도달한 상태에 바탕으로합니다. ALFWorld와 WebShop에서 SMRC-SD는 unconditional successful full-path distillation보다 항상 우수한 성능을 보입니다. Qwen3-1.7B를 사용하면 ALFWorld에서 task success를 0.746에서 0.865로, WebShop에서 0.574에서 0.693로 개선합니다. controlled routing과 context ablation은 이러한 성능 향상에 locally supported 턴을 선택하는 것과 state-compatible teacher context를 생성하는 것의 기여를 지원합니다.
함께 읽으면 좋은 기사
스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion
스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.
AI가 관리하는 수학적 정의의 저고리: Lean Pool
Lean Pool은 AI agent들이 관리, 최적화하는 수학적 정의의 저고리입니다. 이 저고리는 수학적 이론과 공식의 정형화된 아카이브입니다. AI가 관리하는 저고리는 수학적 정의의 정확성과 완전성을 보장합니다.
기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구
최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'
OpenAI, 수학적 문제 100개 이상 해결한 AI에 전문가 조언단 설립
OpenAI는 대규모 언어 모델(LLM)로 수학적 문제를 해결한 이후, 수학적 문제 해결을 위한 전문가 조언단을 설립했습니다. 이 조언단은 OpenAI의 수학적 연구 진행을 늦추거나 방향을 바꾸지 못할 것입니다.
AI가 회계사들을 과감히 폐지할 수 있는 'Tabby'가 등장했습니다!
Tabby는 실시간 회계 인터페이스를 제공하며, 고객의 서류를 처리하는 동시에 업계의 손익을 실시간으로 제공합니다. AI가 회계업무를 자동화하여 회계사들의 역할을 과감히 줄이는 중입니다.
SAS 비전 트랜스폼러에 기반한 강화된 대비 학습
아티클 번호: 2609.21061v1 발표 유형: 새로운 개요: 합성 어레이 소나(SAS)를 사용하는 자동 목표 식별(AUTR)은 고급 해군 기능을 지원하지만, 깊은 학습은 희소한 목표 이미지를, 배경 잡음 및 인간의 평가를 제한한다. 우리는 바다 속 SAS AUTR을 위한 DINOv3 비전 트랜스포머(ViT) 모델을 3단계의 매개 변수 효율적인 프레임워크로 적응시킨다. 단계 1은 ViT 백
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.