본문으로 건너뛰기

블랙박스에서 실행 가능한 논리로: 프로로그 전문가 시스템을 통한 설명 가능한 강화학습

AI 자동 생성

강화학습 정책은 블랙박스로 작동한다. 정책을 프로로그 프로그램으로 변환하여 설명 가능한 강화학습을 만들 수 있는지 알아보았습니다. 변환 과정을 통해 정책의 행동을 재현하고, 사람도 읽을 수 있고, 논리 엔진도 실행할 수 있으며, 최적화도 가능하게 만들었습니다.

연구자들은 정책을 프로로그 프로그램으로 변환하는 3단계 후속 변환 과정을 제안했습니다. 첫 번째 단계는 정책을 추출하고, 두 번째 단계는 정책의 결정에서 순서된 규칙 목록을 유도하고, 세 번째 단계는 결과를 프로로그 프로그램으로.emit합니다. 이후 확장 단계에서는 규칙 집합을 편집하고, 정책 평가가 반환 증가를 인증할 때만 편집을 허용합니다.

연구자들은 네 가지 보증을 증명했습니다. 반환 손실 한계는 증축된 프로그램이 무한 마르코비 quyết단 과정에서 기계적으로 검증할 수 있는 증명서로 만듭니다. 확장 루프는 단조롭게 향상되고, 종료됩니다. 연속 관측 설정에서 변환 가능성 여부를 확인했습니다. 논리적 임계치 인스턴스화는 네트워크를 임의의 신뢰도까지 변환할 수 있으며, 해석 오차는 O(1/B)이며, 반환 간격이 같은 속도로 닫힙니다.

연구 결과

  • 2개의 방 키-문 열기 문제에서 16,944개의 접근 가능한 상태를 가진 확장 프로로그 프로그램은 모든 시드에서 최적 반환을 달성했습니다.
  • 연속 제어 문제에서 3개의 문제에서 방출된 프로그램은 네트워크를 대체했습니다. Acrobot에서 11개의 절차로 네트워크와 일치하고, CartPole에서 97%의 반환을 회복했습니다.
  • 보다 정교한 제어 LunarLander에서 부분적으로 회복되었습니다. 이는 exponential lower bound가 예측한 바와 같이 ceiling에 해당했습니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

연구 6일 전

SAS 비전 트랜스폼러에 기반한 강화된 대비 학습

아티클 번호: 2609.21061v1 발표 유형: 새로운 개요: 합성 어레이 소나(SAS)를 사용하는 자동 목표 식별(AUTR)은 고급 해군 기능을 지원하지만, 깊은 학습은 희소한 목표 이미지를, 배경 잡음 및 인간의 평가를 제한한다. 우리는 바다 속 SAS AUTR을 위한 DINOv3 비전 트랜스포머(ViT) 모델을 3단계의 매개 변수 효율적인 프레임워크로 적응시킨다. 단계 1은 ViT 백

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.