본문으로 건너뛰기

#arXiv

1186개의 기사

AI 모델 6월 26일

대화 모델 내의 자아에 대한 거부는 물결 아래로 살아간다.

대화 모델의 교육을 통해 튜닝된 채팅 모델에서 거부와 인격 특성을 나타내는 선형 방향이 활성화 공간에서 식별되었다. 그러나 두 가지 특성을 별개의 메커니즘으로 연구해왔다. 우리는 두 가지 특성이 상호 작용한다는 것을 보여주었다. 즉, 유연한 인격은 거부를 차단한다. Qwen2.5-7B-Instruct와 Llama-3.1-8B-Instruct에서, 우리는 유연한 모델-인격 방향과 거부 방향을

AI 모델 6월 26일

순수한 선의 계단형 특징을 사용한 동의어 감지 및 관리

이 모델의 행동을 해석하고 제어하기 위해 활성화 방향 메소드를 사용하는 데는 의도된 또는 의도되지 않은 행동을 명확하게 보여주는 많은 대조적 샘플 pair이 필요하다. 이러한 데이터 pair은 해석 가능한 프레임워크가 행동에 대한 책임이 있는 모델 특징을 신뢰성 있게 감지하는 정도를 결정하고, 따라서 행동을 향해 또는 멀어지게 모델을 제어할 수 있는 능력을 결정한다. 이 연구에서, 우리는 대

AI 모델 6월 25일

인간 체스에서의 Elo-해제된 플레이어 스타일 임베딩을 위한 등급 조건된 잔차 이동 모델

인간의 체스 스타일을 학습하는 연구를 진행했다. 각 선수별로 learned embedding을 사용하여 move history를 통해 스타일의 유사성을 측정하며, Elo 점수와는 분리된 embedding을 학습했다. key design는 rating-conditioned base move model을 사용하여 Elo 점수에 따라 선수가 typical하게 움직이는 패턴을 학습하고, learne

에이전트 6월 25일

의사 의사결정의 사유권: 자율 AI 처방의 신뢰, 책임, 불확실성에 대한 탐색

미국 의사들은 의약품 처방을 위한 자율 AI 시스템이 자문 역할에서 자율 역할로 전환하고 있다. 최근 미국 의회 의안 H.R. 238와 유타 주 처방 재발급 시범 사업 모두 AI가 의사 역할을 하는 자율적 용도로 의약품을 처방할 수 있도록 허용하고 있다. 하지만 일부 규제 지침은 AI 모델의 집계 성과 지표를 승인하기만 하며, i) 예측에 대한 계측된 자신감 수준을 행동을 위한 경계값에 대해

AI 모델 6월 25일

비술파이 값 이외의 효율적인 비대칭 Shapley 값 계산

머신 러닝 모델의 설명 가능성을 위한 특성 분배 방법을 연구한다고 합니다. 특히, 불균형 셰플리 값(Asymmetric Shapley Values, ASV)을 연구하여, 모델 독립적인 설명을 위한 인과 관계 지식을 포함하는 방법을 제시한다고 합니다. 셰플리 값의 계산이 #P-난이도 문제인 경우에도, ASV의 정확한 계산은 다항 시간에 가능하다고 합니다. 이 알고리즘 결과를 확장하기 위해, 인

에이전트 6월 25일

대인 설득에서 조합 오류를 진단하고 완화하는 분류 체계 접근법을 활용한 전략 검색

대규모 언어 모델(LLM) 에서 멀티 스텝, 오픈 엔드된 환경에서 발생하는 누적 오류는 초기의 잘못된 판단이 장기적인 트레이JECTORY를 오염시킨다. Multi-Agent Debate (MAD) 는 결정론적 도메인에서 성공을 거두지만 주관적인 과제인 설득과 같은 과제에서는 심각한 문제 드리프트와 수사적인 공복을 경험한다. 우리는 표준 Retrieval-Augmented Generation

에이전트 6월 25일

네트워크 관계 추론기를 자동으로 평가하는 방향으로의 프로젝트: Auto-월드

관계 구조에 대한 논리적 추론은 신경 모델에 큰 도전을 남기고 있으며, 특히 훈련된 모델이 적용해야 하는 지식이 문제 인스턴스가 더 어려운 것보다 harder 한 경우에 그러하다. 이 문제를 해결하기 위해 우리는 대규모 언어 모델(LLM)을 사용하여 벤치마크 생성을 자동화하고, 배포 및 문제 인스턴스를 생성하는 방식으로 어려운 인스턴스를 생성하는 것을 목표로 end-to-end 학습을 수행한

에이전트 6월 24일

모든 경로: Wheelchair 접근성 감사에 대한 다중 모드 적극적 프레임워크

wheelchair 사용자는 일반적인 지도에서 blue색 라인이 종종 깨진 약속으로 나타난다. OpenStreetMap (OSM)과 같은 플랫폼은 도로의 위치를 성공적으로 캡처하지만, 그것을 여행하는 물리적인 느낌을 전달하는 데 자주 실패한다. 이 정보 격차는 wheel chair 사용자에게 문제이다. 이 문제를 해결하기 위해 우리는 OmniPath라는 시스템을 제시한다. 이 시스템은 지도를

AI 모델 6월 24일

VeryTrace: 합성 가능한 형식과 구조화된 검증을 통해 추론 경로를 검증하는 시스템

Chain-of-Thought (CoT) 프롬프트를 사용한 다단계 추론은 논리적인 오류나 조작적인 착상이 초기 단계에서 조용히 전파되어 자신감 있지만 오류가 있는 결론을 생산한다. 이 논문은 VeryTrace라는 zero-shot 검증 및 수정 프레임워크를 제시한다. VeryTrace는 자연어 추론 트레이스(FR: 추론 트레이스)를 구조화된, 컴파일할 수 있는 표현으로 공식화한다. VeryT

에이전트 6월 24일

실제 언어의 다국어 다이얼로그 이미지 부정 확인을 위한 멀티모달 부정 정보 탐지

바이럴 게시물은 이제는 장문의 다언어 문장, 여러 이미지, 혼합된 출처, 그리고 텍스트와 이미지의 서술 오류를 포함하는 것이 더 많아지면서, 다중 모드 정보 오류 탐지의 중요성이 점점 더 커지고 있습니다. 현재의 기준점과 방법들은 여전히 이 환경에 잘 맞지 않고 있습니다: 일반적으로 짧은 캡션, 단일 이미지, 이진 레이블, 또는 하나의 조작 소스를 분리하는 경향이 있습니다. 또한, 현실적인

연구 6월 24일

학술논문 전체 텍스트를 기반으로 하는 공존 네트워크를 활용한 알고리즘의 학술 영향력 탐색

인공지능(AI) 시대에 알고리즘은 과학 연구의 중심이 되었다. 논문에서 알고리즘에 대한 언급은 인기가 많고 영향력이 큰 것을 나타내는 데 사용되지만, 기존의 연구는 일반적으로 개별 알고리즘을 분리된 상태에서 평가하고, 서로 연결된 알고리즘의 집합적인 영향에 대해 제한된 관심을 보였다. 이 연구는 학술 논문 전체 텍스트를 기반으로 자연어 처리(NLP)에서 대규모 알고리즘 동시발생 네트워크를 구

인기 태그