본문으로 건너뛰기

#arXiv

1186개의 기사

AI 모델 6월 24일

트랙토리 이ミ테이션을 넘어서: 전략 가이드 정책 최적화 - LLM 논리 추론을 위한

강력한 언어 모델에서 약한 언어 모델로 추론 능력을 내뇨하는 데 일반적으로 사용되는 방법은 특정 해결책 경로를 모방하는 것이다. 즉, 무엇을 답변해야 하는지 말고는 어떻게 추론해야 하는지 알려주는 것이다. 이 경로 단위 모방은 인스턴스 특정 단계의 기억보다는 전이 가능 문제 해결 기술의 학습을 장려하지 못하고, 새로운 문제에 대한 일반화력을 제한한다. 우리는 Strategy-Guided Po

AI 모델 6월 24일

여성 성노동자의 정신 건강 위험 예측을 위한 Ensemble Feature Selection과 Harris Hawks Optimization

여성 성노동자의 정신 건강 위험 예측을 위한 새로운 모델을 제안했습니다. 이 모델은 ANOVA와 상호 정보를 사용하는 Ensemble Feature Selection 전략과 로지스틱 회귀 분석을 튜닝하는 Harris Hawks Optimization을 결합하여, 고차원 및 복잡한 위험 패턴을 효과적으로 캡처합니다. 또한, 이 모델은 설명 가능한 AI(XAI) 방법을 사용하여 트라우마와 관련된 요인을 이해할 수 있습니다.

에이전트 6월 24일

필터링 구멍을 뚫는 것: 다중 목적 추천을 위한 의미론적 파레토-DQN 프레임워크

추천 시스템은 단순히 즉각적인 사용자 참여를 최적화하기 위해 모노리식으로 최적화함으로써 필터 버블과 의미론적 동일화 현상을 유발한다. 표준 단일 목표 모델, 전통적인 딥 퀀트 네트워크를 포함하여, 플랫폼 유지와 정보 다양성 및 제공자 공정성과 같은 중요한 사회적 가치의 상호 작용을 탐색하기에 적합하지 않다. 이러한 한계를 해결하기 위해 우리는 추천을 의미론적 다목표 마르코프 결정 프로세스로

AI 모델 6월 24일

강화 학습을 통한 광범위하고 지속적인 이익을 주는 모델 개발

인공지능(AI) 시스템이 점점 더 다양하고 중요한 환경에서 배치되면서, 모델의 정렬(model alignment)이 훈련된 작업과 도메인 이외의 범위까지 일반화해야 한다. 특히 강화 학습(Reinforcement Learning, RL)은 보상 HACKING, 사기 행위, 또는 의도하지 않은 전략을 통해 예상치 못한 불일치를 도입할 수 있다. 우리는 RL이 교육 데이터 분포 이외의 넓고 지속

에이전트 6월 24일

안전하고 일반화 가능한 계층적 다중 agent RL을 위한 제약 매니폴드 제어

안정성이 중요한 응용 프로그램에서 협력 동작이 필요할 때 다중 에이전트 시스템은 널리 사용됩니다. 기존의 접근 방식에는 문제가 있습니다: 학습 기반 방법은 강력한 경험적 성능을 달성하지만 이론적 안전 보장 보장이 없습니다. 반면 제어 이론 기반 방법은 안전성을 강제하지만 종종 과도한 보수적이고 비효율적인 행동을 초래합니다. 우리는 제약 매니폴드(Constraint manifold)로 하위 수

에이전트 6월 24일

agent 모델 비판

인공지능(AI) agent란 무엇이며, agent라는 개념이 어떤 의미를 가지고 있는지에 대해 명확히 하기 위해 노력해야 한다. 대규모 언어 모델(LLM)과 같은 인공지능 시스템이 개발되고, 개발자는 이 시스템을 "코딩 agent", "AI 공동 연구원" 등으로 홍보하고 있다. 또한, 인공지능이 인간의 통제를 벗어나 해를 입히는 "기계적 agency"라는 측면에서 인공지능에 대한 존재론적 우

연구 6월 24일

신경symbolic 주행: 규칙 기반 신뢰할만한 주행을 위한 VLAs의 합리적 추론

VLA 모델을 Chain-of-Thought (CoT) 사고 방식으로 구현한 드라이빙 모델은 미리 학습된 VLM 표현을 활용하고 자연어로 중간 결정을 노출할 수 있기 때문에 매력적입니다. 그러나 현재의 합리화는 계획된 동작과 논리적으로 연결된 중간 결정을 유지하기 위해 필요한 단계별 결정 의미론이 부족합니다. 우리는 Neuro-Symbolic Drive, 심볼릭 AI 시스템인 규칙 기반 계획

에이전트 6월 24일

AI 시스템의 동적 적대자 테스트 도구

인공지능(AI) 시스템은 대규모 언어 모델(LLM)으로 구동되는 주체적 인공지능 시스템들이 빠르게 자율적인 의사결정 시스템으로 발전하고 있다. 기존의 보안 평가 방법은 특정 구현이나 도메인과 관련이 있어, 다종의 시스템에 대한 통합적인 비교는 어려워진다. 이를 해결하기 위해 RIFT-Bench를 제안하는데, 이는 그래프 표현을 기반으로 하는 동적 레드팀링(Red Teaming) 방법론으로 다

에이전트 6월 23일

알파메모: 구조화된 검색-프로세스 메모리 기반 자가 진화하는 알파 채굴.agent

대규모 언어 모델(LLM) agent는 금융 전제, Symbolic Reasoning, 실행 가능 요인 생성 및 feedback-driven 개선과 결합하여 알파 채굴을 위한 유망한 솔루션입니다. 그러나 combinatorial 검색 공간, noisy non-stationary feedback, 중복 발견 및 과적합 위험을 해결하기 위해, 우리는 구조화된 검색-프로세스 메모리 기반 자가 진화하는 알파 채굴 agent인 알파메모를 제안합니다.

AI 모델 6월 23일

LLM 논리 reasoning에서 비합리성은 가치 부합성에 얹혀있다.

대규모 언어 모델(LLM)을 목표 가치 함수와 일치시키는 데 있어 중요한 진전이 이루어졌습니다. 우리는 LLM이 (포스트-)학습 시 잘 일치되더라도, 여전히 합리적인 가치 maximization에서 실패할 수 있음을 주장합니다. 이 간격을 합리적 가치 위험(rational value risk)으로 정의하여 수학적으로 정의합니다. 이는 모델의 배포된 추론 전략과 합리적인 동등체가 되는 응답의

연구 6월 23일

경로에 의존하는 프로그램 유도와 리소스 제약은 인간 시퀀스 학습을 설명한다.

인간은 경험의 순서에 따라 제약된 인지 자원에서 추상적이고 재사용 가능한 지식을 어떻게 구축할까요? 이 질문에 대한 답을 위해, 우리는 프로그램 인덕션의 최근 발전과 정보-왜곡 이론을 통합하여 미래 구조가 쉽게 인코딩되고 발견되는 것에 영향을 미치는 이전 지식의 형태를 설명합니다. 이 개념을 계층적 어댑터 문법(Hierarchical Adaptor Grammar, HAG)으로 공식화하고, 이

에이전트 6월 23일

다윈 모바일 에이전트: 자가 진화의 lộ차트

인공지능의 목표는 열린 환경에서 일반적이고 유연한 행동을 하는 agent를 만들기 위해서이다. '비ITTER LESSON'을 따르면서, 우리는 인공지능을 달성하기 위한 가장 효과적인 경로는 인간의 전제를 제거하고 agent가 대규모 언어 모델(LLM)보다 훨씬 더 복잡한 '빅 월드'와 상호 작용하여 자연스럽게 출현하도록 하는 것이다. 우리는 휴대용 그래픽 사용자 인터페이스(GUI)를 이러한

에이전트 6월 23일

퍼뮤테이션-동등성 적응형 라우팅 멀티 에이전트 토론

대규모 언어 모델(LLM)의 신뢰성을 향상시키기 위해 반복적인 동료 비판을 통해 Multi-agent 토론이 개선되었다. 그러나 고정된 토폴로지는 지속적인 위치 편향을 유발하고, 불신할 수 있는 에이전트를 증폭시키며, 역할 assignement에 대한 민감도를 높인다. 우리는 Permutation-Equivariant Adaptive Routing Multi-Agent Debate(PEAR)

AI 모델 6월 23일

새로운 협동주의: 깊은 학습에서 배운 교훈

현대 인공지능의 성공은 인간이 배우는 방식에 무엇을 알려주고 있는 걸까? 이 논문은 인공지능을 인간 학습의 모델로 nghiêm중하게 다루면, 가볍지만 진실한 연관주의를 지지한다고 주장한다. 주된 발견은 평가적인 피드백에 의해 주도되는 학습이, 대규모 언어 모델부터 게임을 즐기는 agent까지, 놀랍게도 현대 인공지능 시스템의 광범위한 범위에 걸쳐 있음을 의미한다. 이들은 주로 관련 피드백 신

AI 모델 6월 23일

고정 예산 이상: Tree-of-Thought 사고 전략의 무탄성성 및 한계 특성화

Tree of Thought(Tot) 검색이 대규모 언어 모델의 추론 능력을 향상시키기 위한 유망한 방향이 되었지만, 이 방법들을 실제로 적용하는 것은 다음의 질문에 대한 체계적인 연구가 거의 이루어지지 않은 문제를 제기한다: 다루는 컴퓨트 비용, 모델 크기, 문제의 난이도에 따라서 다르게 행동하는 다양한 검색 전략은 어떻게 행동하는 것일까? 이 연구에서, 우리는 두 가지 대표적인 Tot 방

연구 6월 23일

사용자 적응성 식별성에 대한 연구: 코어 적응형 신경 인터페이스

코어 적응형 신경 인터페이스에서 사용자 적응성의 식별성에 대한 연구를 진행하였습니다. 연구 결과, 클로즈드 루프 인코더 추정치가 사용자 적응성을 유일하게 식별하지 못하고 대신 제자리 시스템의 속성을 반영한다는 것을 확인하였습니다. 이러한 연구 결과는 행동적 적응의 해석에 대한 중요 함을 강조하고 식별 조건을 제시하였습니다.

인기 태그