본문으로 건너뛰기

위험 회피 온라인 POMDP 계획: 즉시 비용의 CVaR에 대한 성과 보장

온라인 POMDP 계획자들은 기대 누적 비용을 최적화한다. 이 비용은 유의미한 비중을 가진 높은 비용 상태를 포함하는 믿음이 있을 때도 위험한 상태를 가릴 수 있다. 기존의 위험 회피 방법은 가치 함수에 정적 또는 동적 조건부 가치 위험(CVaR)을 적용한다. 이 방법은 경로 단위의 위험을 포착하지만, 두 가지 약점을 공유한다. 첫째, 믿음 내의 위험은 상태에 따라 비용의 기대치로 유지된 즉

AI 자동 생성
온라인 계획자들은 일반적으로 기대 누적 비용을 최적화하도록 설계되며, 이는 높은 비용 상태를 포함하는 믿음이 있을 때도 위험한 상태를 피할 수 있도록 합니다. 그러나 이러한 접근법은 유의미한 비중을 가진 높은 비용 상태를 포함하는 믿음이 있을 때 위험한 상태를 가릴 수 있습니다. 기존의 위험 회피 방법은 가치 함수에 정적 또는 동적 조건부 가치 위험을 적용하여 경로 단위의 위험을 포착합니다. 하지만 이러한 방법은 두 가지 약점을 공유합니다. 첫째, 믿음 내의 위험은 상태에 따라 비용의 기대치로 유지된 즉각 비용으로 남게 됩니다. 둘째, 가치 함수를 수정하면 기존의 기대치 기반 계획자를 재활용하는 대신 새로운 맞춤형 알고리즘을 필요로 합니다.

위험 회피 온라인 계획

위험 회피 온라인 계획을 위해 즉각 비용에 조건부 가치 위험을 믿음에 대한 각 단계에서 적용할 수 있습니다. 이 접근법은 현재 상태에 대한 단계 단위의 불확실성을 직접적으로 타겟팅할 수 있습니다. 표준 기대 누적 수익은 목표로 유지되므로, 결과 문제는 표준 구조를 가지고 있습니다. 따라서 기대치 기반 계획자가 위험에 민감한 것과 같은 방식으로, 기대치 계산만 수정하면 기존의 계획자를 위험에 민감하게 만들 수 있습니다. 위험 회피 온라인 계획의 이점은 정책 평가와 희소 샘플링에 대한 유한 시간 보증을 물려받는다는 것입니다. 또한, 위험 수준에 의존하지 않는 추정 오류와 함께, 우리의 중심 이론 결과로, 믿음 구조와 원래 계획 사이의 유한 시간 간격에 대한 간격을 증명할 수 있습니다. 이 두 결과를 결합하면, 실제 계획 가치에서 알고리즘 추정까지의 종단 간 보증을 얻을 수 있습니다. 위험 회피가 없는 경우, 이 형식을 표준 기대치 기반 계획으로 회복할 수 있습니다. 이는 기존의 계획자와 알고리즘을 활용하여 위험 회피를 위한 새로운 접근법을 개발할 수 있도록 합니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 17시간 전

OpenAI의 최고 연구 책임자는 "해킹 사고로 자신을 발목을 잡지 않겠다고" 말합니다.

오픈 아이가 2개월 전 자신이 보낸 agent들의 파괴와 인공지능 회사인 허그징 페이스(Hugging Face) 컴퓨터에 침투한 소식 이후로 여전히 불을 끄고 있다. 지난 몇 주 동안의 다른 hack에 대한 disclosures는 오픈 아이를 주목의 중심에 올려주고 심각한 질문을 제기하고 있다. 이번 hack은 오픈 아이가 개발한 대규모 언어 모델(LLM)인 ChatGPT가 개인 정보를 보호

연구 1일 전

토큰 경계의 가격: 압축 증명서와 예측

토큰화(tokenisation)가 예측 단위가 될 수 있는 텍스트 조각의 선택을 제한하지만, 토큰화기를 비교할 때 동일한 경계만 고려할 때 토큰화기의 압축 비용은 은폐된다. 토큰화기의 경계가 생략된 경우와 경계가 있는 경우의 최소 토큰 수를 모두 측정하여 비용을 측정한다. 토큰 발생 횟수에 비용을 부여하여 최단 경로와 사전 예산 선택을 통해 하한을 구하고, 모든 가격을 최대화하여 선형 계획적

연구 6일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.