본문으로 건너뛰기
연구 6월 2일

비대칭 클리핑 비지도 학습 알고리즘: GRPO를 위한 우위 플립핑 기반 비권리 클리핑 비대칭 자가 교육

RLVR(Reward가 검증 가능한 학습, 특히 그룹 상대적 정책 최적화(Group Relative Policy Optimization, GRPO))는 대규모 언어 모델의 추론을 향상시키기 위해 광범위하게 사용되어 왔습니다. 그러나 결과 단계에 대한 보상은 희박한 감독만 제공하고, 특정 프롬프트에 대해 샘플링된 모든 경로가 모두 올바르거나 잘못된 경우 그룹 상대적 이점은 사라집니다. OPSD

연구 6월 2일

확률 개념의 발달은 사유의 발달을 반영한다

수세기 동안 확률론은 게임의 계산에서 시작되어 불확실성에 대한 합리적인 판단의 중심 프레임워크로 성장했습니다. 이 기사는 그 진화가 단지 수학적 역사로만 보는 것이 아니라 합리성의 변천으로 해석하는 것입니다. 파스칼과 페르마트의 조합적 균형에서 베이즈와 라플라스의 유추 논리를, 푸아송의 사건 통계에서 콜모고로프의 조건부 정식화까지, 확률론은 점점 더 불확실성, 시간, 그리고 일관성을 과학적

연구 6월 2일

공유 우주 양자 전환기

클래식 연속 공간 신경망은 모듈러 대수학 및 비가환 대수학과 같은 정확한 수학적 공리즘에 대한 정확한 매개변수 조절을 달성하기 위해 큰 매개변수 조절을 사용하여 이러한 이산 논리 규칙을 근사화할 때, 대규모 매개변수 조절을 통해 이들 공리즘에 대한 정확한 매개변수 조절을 달성하기 위해 이들 공리즘을 근사화하는 경우, 일반화 현상이 지연되면 발생하는 확률적 Instability를 포함하여, 이

연구 6월 2일

해양 風력장치 배치 최적화: 최적輸送 기반 교환 불변 베이즈 최적화

베이즈 최적화(Bayesian Optimization, BO)는 비용이 많이 들고 블랙박스, 비convex objective function을 갖는 최적화 문제를 해결하는 데 성공적으로 사용되고 있습니다. 그러나 기본 베이즈 최적화 알고리즘은 목표 문제의 가능성 있는 대칭성을 활용할 수 없습니다. 해양 풍력장치 배치 최적화는 이러한 대칭성을 활용할 수 있는 예입니다. 동일한 풍력장치는 연간 에너지 생산에 영향을 주지 않습니다. Optimal Transport 이론을 기반으로 한 교환 불변 베이즈 최적화(PIBO) 접근법을 제안하여 풍력장치 배치를 개선하고 계산 시간을 절반으로 줄일 수 있습니다.

연구 6월 2일

결정 엔진 내에서의 해결 후 강건성: 변화에 대한 연속성과 가능 영역

산업계의 고위험 시스템에 대해 Mixed-Integer Linear Programming(MILP) 의사결정 엔진은 일반적으로 최적의 계획을 출력합니다. 하지만 실제로 배포는 해결 시간에 대한 가정과 일치하지 않습니다: 비용, 수요 또는 자원 제공 가능성에 대한 작은 변동이 합리성 또는 질적으로 다른 솔루션으로의 불연속적인 shift를 유발할 수 있습니다. 우리는 오늘날 최적화 pipelin

연구 6월 1일

FTS를 이용한 SAT 해결을 위한 변환 및 인코딩: 도움이 되는 것, 해가 되는 것 (확장 버전)

연구 논문(arXiv:2605.30563v1)에서 발표된 내용입니다. 사전 계획 표현의 한 형태인 요인화된 작업(task)은 조건부 효과, 불확실성, 그리고 불가결한 조건의 한 형태를 포함하는 SAS+를 확장한 것입니다. 이는 전통적인 형식인 STRIPS나 SAS+와 같은 작업들의 더紧한 표현을 지원하며, 다양한 작업 변환을 지원합니다. 그러나 기존의 계획 방법은 힌트 검색 방법에만 제한되어

연구 5월 29일

데몰리션 공화국의 이부리성 전염병, 사망자 증가로 전염병 통제 어려워

데몰리션 공화국의 이부리성 전염병이 사망자 증가로 전염병 통제를 어렵게 하고 있습니다. 이부리성 전염병은 5월 5일부터 사망자가 발생하기 시작하여, 급속한 대응팀이 현장에 파견되어 조사하였습니다. Kinshasa의 연구 센터에서 진행된 검사 결과, Bundibugyo 바이러스로 인한 전염병이 확인되었습니다.

연구 5월 29일

직교 개념 지우기 diffusion 모델의 개념

concept 삭제를 위한 방안으로서 diffusuion 모델 내의 불쾌하거나 위험한 콘텐츠를 제거하는 concept erasure는 새로운 접근 방식으로 등장하였습니다. 그러나 기존의 방법은 여전히 한계를 가지고 있습니다. 기반 학습 기반의 방법은 효과적이지만, 높은 계산 비용으로 인해 확장성에 제한이 있습니다. 편집 기반의 방법은 효율적이고 배포 가능하지만, 동시에 정교한 concept

연구 5월 29일

열대 우림에서 항공 로봇 시스템을 이용한 선택적 지속가능한 벌채 및 포스트 하베스트 임산 식물 치료를 위한 새로운 방법을 제안: URIEL(Ultra-Reduced-Impact-Encased-Logging)

세계 곳곳의 열대 우림은 경제적이고 정치적인 이익으로 인해 강도 높은伐지 압력을 받고 있으며, 과학적 증거는 이 伐지가 기후 변화에 기여한다고 한다. 이 논문은 열대 우림에 대한 새로운伐지 방법, 유라-리-엘(Ultra-Reduced-Impact-Encased-Logging, URIEL)을 제안한다. 이 새로운 방법은 헬리-伐지 기술과 로봇과 인공지능(AI)을 통합한 드론이 수행하는 후처리

연구 5월 27일

지속 가능한 스킬을 위한 지역 동적regularity: 오프라인 계층적 강화 학습

오프라인 계층적 강화 학습에서 지속 가능한 스킬을 얻는 것은 여전히 열린 문제입니다. 연구팀은 지역 동적regularity를 활용하여 지역 전이와 전역 컨텍스트 간의 유사한 행동 시퀀스를 학습하여 지속 가능한 스킬을 재사용하는 데 도움을 주는 알고리즘 CARL(Contrastive Action-based Representations for Reusable Local Control)을 제안했습니다. CARL은 복잡한 인공인간 환경에서 의미 있는 스킬의 군집화를 보였고, OGBench 벤치마크에서 HIQL과 통합되었을 때 다운스트림 성능을 향상시켰습니다.

연구 5월 27일

인간 등급의 자율 연구를 위한 증거链을 통해

자율 연구 요원은 경쟁적인 해결책과 전문적인 서류를 생산하지만, 표면 수준 평가로 인식되지 않는 검증성 실패를 포함한 출력물을 생성합니다. 이는 인용이 조작된 것, 재현 불가능한 점수, 구현과 달리 메소드 설명 등입니다. 이를 해결하기 위해 세 가지 기여를 제시합니다. 첫째, Chain-of-Evidence(증거 chain, CoE)라는 검증성 프레임워크입니다. 이는 모든 주장을 증거 소스로

연구 5월 23일

인공지능의 사용과 정보성의 영향은 논리적 추론의 기술 개발에

인공지능(AI)의 사용과 정보성은 인간의 문제 해결에 점점 더 통합되고 있지만, 개인 기술 개발에 미치는 영향은 여전히 불분명하다. 논리적 이론 arXiv:2605.21695v1 발표 유형: 새로운 추론: 인공지능(AI)은 인간 문제 해결에 점점 더 통합되고 있지만, 개인 기술 개발에 미치는 영향은 여전히 불분명하다. 인공지능 사용과 정보성은 어떻게 AI를 사용하지 않는 일치하는 사용자와 마찬가지로 학습을 형성할 수 있는지 살펴보았습니다. 우리는 AI 지원에 대한 수요에 따라 통제된 논리적 이론

연구 5월 22일

Mahjax : JAX에서 강화 학습을위한 GPU 가속화 된 Mahjong 시뮬레이터

Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX arXiv:2605.20577v1 Announce Type: new Abstract: Riichi Mahjong은 스토하스틱과 고차원 상태 공간에 의해 특징을 갖춘 멀티 플레이어, 불완전한 정보 게임입니다. 이러한 특성은 강화 학습에서 복잡한 실제 의사 결정 문제를 반영하는 독특한 조합을 제공합니다. 이전 연구는 정책을 사전 교육하기 위해 인간 플레이 로그에서