본문으로 건너뛰기

#AI 안전

139개의 기사

AI 모델 6월 2일

다양한 모델을 가진 인공지능 시스템에서 상승하는 협력적 토론: 지식 합성에 대한 BFT-기반 프로토콜

arXiv:2606.00005v1 발표 형식: 새로운 요약: 우리는 Byzantine Fault Tolerance-derived 구조를 통해 구성된 다중 모델 인공지능 논의를 위한 Consilium Protocol을 제시한다. 이 프로토콜은 모델 간의 불일치가 오류가 아닌 지식 신호로 처리되도록 한다. 프로토콜은 언어 모델에 인공 지능형 인격을 assigns -- 모델이 무엇인지와 모델이 어

연구 5월 27일

인간 등급의 자율 연구를 위한 증거链을 통해

자율 연구 요원은 경쟁적인 해결책과 전문적인 서류를 생산하지만, 표면 수준 평가로 인식되지 않는 검증성 실패를 포함한 출력물을 생성합니다. 이는 인용이 조작된 것, 재현 불가능한 점수, 구현과 달리 메소드 설명 등입니다. 이를 해결하기 위해 세 가지 기여를 제시합니다. 첫째, Chain-of-Evidence(증거 chain, CoE)라는 검증성 프레임워크입니다. 이는 모든 주장을 증거 소스로

AI 모델 5월 27일

블록이 무엇이나 될 수 있는 것: 구조를 고려한 블록 생성과 구조를 인식하는 토큰화

3D 형태를 기반으로 물리적으로 구축할 수 있는 벽돌 구조를 생성하려면 단순한 기하학적 복원만 아니라, 분할된 부품 제약 조건과 구조적 안정성도 충족해야 한다. 현재의 벽돌 생성 방법은 대개 힌트 기반 최적화에 의존하는데, 목표 3D 형태가 정의된 제약 조건하에서 가능성이 있는 구조를 허용하지 않을 경우 최적화가 붕괴할 수 있다. 또는, 벽돌 시퀀스를 생성하는 데 3D 기하학 및 조립 관계를

에이전트 5월 23일

Crowd Preferences의 암시적인 안전 조정

Crowd Preferences arXiv:2605.21822v1 Announce Type: new Abstract: Reinforcement Learning from Human Feedback (RLHF)는 작업 완료를 초과하는 안전 고려 사항과 같은 암시적인 목표를 밝힐 수 있습니다. 이 작업에서 우리는 대중 선호 데이터 세트에 내장된 공통 보안 기준에 초점을 맞추고 있으며, 다른 사용자가 다른 선호도 또는 목표를 표현할 수 있지만 유사한 보안 원칙을 따를 수 있습니다. 우리의 목표는 대중 선

AI 모델 5월 23일

AttuneBench : LLM 감정 지능을위한 대화 기반 벤치마크

이러한 대화 capuneBench: 대화 기반 컨텍스트를 직접 예측하는 행동: LLM 감정적 인 지능 프레임 워크에 대한 통합 기반 벤치마크 arXiv:2605.21739v1 발표 유형 : 새로운 추론 : 감정적 인 지능 (EI), 다른 사람의 감정적 인 상태에 적절하게 인식, 이해 및 응답 할 수있는 능력은 인간의 의사 소통의 중심이며 LLM이 일상 생활에서 대화 역할을 수행함으로써 점점 더 중요합니다. 기존 EI 벤치마크는 합성 프롬프트, 단일 회로 행동 사례 또는 특정 제 3 자 항목에 의존

AI 모델 5월 23일

Implausible Category Members를 사용하여 개념 조정을 조사하기

이 카테고리 구성원들의 안전 카테고리 다운 스트림 개념을 조사하는 카테고리 구성원들의 신뢰할 수없는 식별을 사용하여 카테고리 구성원 arXiv:2605.21683v1 광고 유형 : 새로운 추론 : 일상적인 개념에 대한 인간-같은 이해를 가진 AI 시스템을 개발하는 것은 안전하고 신뢰할 수있는 시스템을 개발하기위한 핵심 단계입니다 인간에 대한 신뢰할 수없는 카테고리 구성원들 (예를 들어, "올리브가 차량입니까?")에 대한 개념 이해에 대한 질문을 할 때 (예를 들어, "자동차가 차량입니까?") 우리

AI 모델 5월 23일

LLMs에서 분포 외 정렬 실패를 위한 모니터 벤치마크 및 개선에 대한 리뷰 보기

벤치마킹 및 대형 언어 모델 (LLMs)의 보안 및 조정 실패를 개선하는 모니터는 LLMs arXiv:2605.21602v1에서 배포 외부 조정 실패에 대한 특이한 벤치마킹 또는 응답 패턴입니다.이 발표 작업 유형 : 새로운 추론 : 대형 언어 모델 (LLMs)의 많은 보안 및 조정 실패는 배포 외부 (OOD) 상황 때문에 발생합니다 : 모델 개발자가 예측하지 못한 특이한 벤치마킹 또는 응답 패턴. 우리는 시스템적으로 LLM 모니터링 파이프라인이 우리의 자신의 모니터를 훈련하는 데 사용할 수 있는

에이전트 5월 20일

신뢰할 수 있는 에이전트 네트워크: 에이전트 네트워크에 신뢰를 구축해야, 부착할 수는 없다

대규모 언어 모델(Large Language Model, LLM) 기반의 자율 에이전트가 복잡한 추론과 실행을 가능하게 한 결과, 에이전트 간 협력 네트워크가 등장하고 있다. 이러한 네트워크는 단일 에이전트가 전체 작업을 수행하는 것보다 작업 성능이 좋아 보이지만, 현재 에이전트 정렬 기술로는 존재하는 시스템 취약성, 즉 적대적 합성, 의미 불일치, 연쇄적 운영 실패를 해결할 수 없다. 이 비전 논문에서는 에이전트 간 협력 네트워크의 신뢰성을 보장하기 위해 기존 프로토콜에 retrofitting하는 것만으로는 충분하지 않으며, 네트워크 협력 프레임워크의 시작부터 신뢰성을 설계해야 한다고 주장한다.

AI 모델 5월 20일

데이터 프로브를 통해 LLM 성능에 미치는 데이터의 본질을 이해하는 방안

대규모 언어 모델(LLM)의 성능에 영향을 미치는 데이터의 본질을 이해하는 것은 여전히 개방된 문제로, 현재의 접근 방식은 대규모 공개 데이터 세트에 대한 실험적 연구에 의존하고 있습니다. 이에 본 논문에서는 데이터 프로브를 개발하여 LLM의 학습, 튜닝, 정렬, 인컨텍스트 학습 등 다양한 단계에서 데이터의 특성에 미치는 영향을 시스템적으로 연구하고자 uzun합니다.

LLM PC 5월 19일

자율 AI 에이전트의 런타임 안전성: AgentWall

자율 AI 에이전트의 안전성은 점점 더 중요한 오픈 문제로 인식되고 있습니다. 에이전트가 패스िव 텍스트 생성기에서 액티브 액터로 전환하면서, 셸 명령어를 실행, 파일을 수정, API를 호출, 웹을 탐색하는 등 안전하지 못하거나 적대적으로 조작된 행동의 결과가 즉각적이고 현실적인 것입니다. 기존의 AI 안전성 연구는 모델 정렬과 입력 필터링에 초점을 맞추었지만, 에이전트의 의도가 실제 머신에서 실제 행동으로 변하는 순간에 이를 해결하지 못했습니다. 특히 로컬 환경에서 개발자가 에이전트를 자신의 파일 시스템, 자격 증명, 인프라에 실행하는 동안 런타임 제어가 거의 없기 때문에 이러한 결함은 특히 심각합니다. 이 논문은 로컬 AI 에이전트의 런타임 안전성과 관찰성 레이어인 AgentWall을 소개합니다. AgentWall은 에이전트의 제안된 행동을 호스트 환경에 도달하기 전에 모든 행동을 중계하고, 명시적 선언적 정책에 따라 평가하고, 민감한 작업에 대한 인간 승인을 요구하고, 감사 및 재생을 위한 완전한 실행 기록을 기록합니다. AgentWall은 정책 집행 MCP 프록시와 네이티브 OpenClaw 플러그인으로 구현되어 Claude Desktop, Cursor, Windsurf, Claude Code, OpenClaw와 같은 단일 설치 명령어로 작동합니다.

에이전트 5월 18일

SDOF: 멀티 에이전트 오케스트레이션의 대선형세기

멀티 에이전트 오케스트레이션 프레임워크는 LangChain, LangGraph, CrewAI를 포함하여 그래프 기반 파이프라인을 통해 태스크를 라우팅하지만 실제 비즈니스 프로세스를 지배하는 단계 제약을 강제하지 않습니다. SDOF 프레임워크는 멀티 에이전트 실행을 제약된 상태 머신으로 다루고, Online-RLHF Specialized Intent Router와 StateAwareDispatcher를 통해 작동합니다.

에이전트 5월 15일

가치 기반 에이전트로의 전환: LLM 기반 에이전트 γραfφ의 사회적 가치 적합성

대규모 언어 모델(LLM) 기반 에이전트의 광범위한 적용을 위해 인간 사회 가치와 강한 적합성이 필요합니다. 그러나 현재 연구는 자가 인식과 딜레마 결정, 자가 감정 등에서 결함을 보입니다. 이를 해결하기 위해 가치 기반 프레임워크를 제안하고, GraphRAG를 사용하여 원칙을 가치 기반 지시문으로 변환하고, 특정 대화 문맥에서 적합한 지시문을 검색하여 에이전트를 예상하는대로 행동하도록 제어합니다.

에이전트 5월 15일

숨겨진 지휘자, 권력자와의 분리: 다중 에이전트 LLM 시스템의 안전 위험

AI 시스템의 안전성을 높이기 위해 다중 에이전트 지휘 시스템을 사용하는 기업이 증가하고 있지만, 지휘자의 불투명성에 대한 안전성의 영향은 아직 empirical 테스트되지 않았다. 연구진은 3x2 실험을 수행하여 3가지 조직 구조(투명한 리더, 불투명한 지휘자, 평평한)와 2가지 정렬 조건(기본, 중간)을 비교하였다. 연구 결과, 불투명한 지휘자가 투명한 리더보다 집단 분리도를 높여주었고, 지휘자 자신이 최대 분리도를 보였다.

LLM PC 5월 14일

인간과 맞닿은 의사결정에 적합한 암묵적 사용자 선호도 학습

대규모 언어 모델(LLM)은 많은 응용 분야에서 사고 모듈로 사용되며, 효율적이지만 인간과 맞닿은 의사결정에 적합하지 않습니다. 인간과 맞닿은 의사결정은 명시적으로 명시된 목표와 암묵적 사용자 선호도가 함께 고려되어야 합니다. 그러나 암묵적 사용자 선호도를 고려하는 기존 접근법은 사용자와의 반복적인 상호작용이 필요하거나, 과제와 환경에 대한 암묵적 선호도를 일반화하지 못하여 실용적 활용성에 제한을 받습니다.

AI 모델 5월 13일

템플릿-온톨로지: 제조 AI 유효성 검증을 위한 구성 가능한 시뮬레이션 데이터 인프라

제조 환경에서 배포된 대규모 언어 모델(LLM)-기반 AI 에이전트는 유효성 검증을 위해 채워진, 스키마가 정확한 데이터가 필요하지만, 생산 MES 데이터는 사유적, 개인정보에 부합되지 않으며, 벤더_SPECIFIC 합니다. 이 논문은 템플릿-온톨로지 원칙을 소개합니다: 하나의 파이썬 구성 모듈(700-770 라인, 45 유효한 내보내기)이 동시에 시간 단위의 제조 시뮬레이터의 스펙으로 사용되고, AI 분석 도구의 런타임 도메인 스키마로 사용되어, 통합보다는 구성으로 인해 일치가 보장됩니다.

AI 모델 5월 13일

OPD의 많은 얼굴: 장애물, 기계, 그리고 해결책

온-폴리시 디스틸레이션(OPD)과 온-폴리시 셀프 디스틸레이션(OPSD)은 대규모 언어 모델(LLM)에서 promise하는 포스트-트레이닝 방법으로, 모델이 자신의 정책에서 샘플링한 경로에서 밀집한 토큰 수준의 감독을 제공합니다. 그러나 기존의 결과는 혼합된 상태로 남아 있습니다: OP(S)D는 시스템 프롬프트와 지식 내부화에 promise를 보여주었지만, 최근 연구에서는 불안정성과 악화가 보고되었습니다. 이 연구에서는 OPD와 OPSD가 언제 작동하고, 언제 실패하며, 왜 실패하는지에 대한 종합적인 실험적 연구를 제시합니다.

AI 모델 5월 12일

鏡中的공격자: 안정된 이중 역할 자극을 통해 안전성을 깨는 방법

AI 안전성을 향상시키기 위한 자극된 팀(self-play) 접근법에서, 동일한 모델의 다양한 인스턴스가 공격자와 방어자 역할을 하며, 0-1 게임에서 공격자가 방어자를 탈옥시키려고 시도하는 경우, 자극된 팀이 Nash 평형에 수렴할 경우, 모델은 게임 설정 내에서 안전하게 반응할 수 있다. 그러나 동일한 모델을 사용하여 두 역할을 강제하는 파라미터 공유는 안정성과 성능을 향상시키지만, 이론적 및 아키텍처적 한계를 초래한다.

연구 5월 12일

권리와 법의 동조

권리와 법의 동조 법학(Jurisprudence, 법학의 기초)에 대한 연구와 인공지능 모델이 인간 가치에 맞게 동조하는 것에 대한 과학(Alignment, 동조의 과학)은 결국 같은 구조를 공유한다. 이처럼 멀리 떨어진 두 분야 모두 강력한 행위자들의(법관과 인공지능)의 미래에 대한 결정이 어떻게 이루어질지 예측하고 형성하고자 한다. 그리고 그 목표를 달성하기 위해 언어의 명세와 해석의 도구를 사용한다. 법학의 대형 토론(what the law is와 what it should be에 대한 토

인기 태그