본문으로 건너뛰기

글로벌 위험의 한계를 넘어서는 텍스트-이미지 생성의 안전성 분석

AI 자동 생성

텍스트-이미지 생성을 위한 안전 장치로 자주 사용되는 재사용 가능한 안전 신호는 보통 broad하게 모든 요청에 적용되는 불안전한 방향이나 전역적으로 독성 subspace를 의미합니다. 우리는 전역-불안전 가정의 조밀한幾何학적 분석을 제공하고, 불안전한 의미학의 다양성에 대한 compact한 불안전 subspace의 미비를 발견하고, 더 넓은 aggregation은 안전-변경 benign 요청에 대한 안전 장치의 왜곡을 증가시킨다는 것을 밝힙니다. 이러한 발견에 의해 мот티브화된 CALM (Counterfactual Adaptive Local Modulation), training-free 안전 장치가 제시됩니다. CALM은 uniform global removal 대신 prompt-local counterfactual correction을 사용합니다. CALM은 matched unsafe-benign anchor를 사용하여 각 요청을 활성화된 불안전 카테고리로 라우팅하고, 안전한 방향으로 최소한으로 수정한 위반 토큰 표현과 안전한 잔여 성분을 양의 대응으로 억제합니다. CALM은 broad evaluation에서 불안전한 콘텐츠 억제를 크게 향상시키면서 benign utility를 보존하며, global unsafe signal removal 대신 local counterfactual correction이 더 선택적인 대안임을 보여줍니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 7시간 전

자연적 시각성 그래프 기반 사이버 공격 탐지에 대한 다중 방법 중요성 및 성능 효율성 분석

자연적 시각성 그래프(NVG) 기반 분석을 통해 네트워크 트래픽을 다각적인 구조적 특성 반영하는 토폴로지적 특징으로 구분할 수 있습니다. 그러나 모든 특징이 사이버 공격 분류에 동일하게 기여하지는 않으며, 대규모 특징 집합 추출은 계산 비용을 증가시킬 수 있습니다. 이 연구에서는 21 가지 NVG 유도 토폴로지 메트릭을 평가하고, 집계된 메트릭 집합이 분류 성능을 유지하면서 계산 효율성을 개선할 수 있는지 조사합니다.

연구 7시간 전

실행 가능한 세계에 깊어지는 개입: 월드 편집

arXiv:2610.02331v1 발표 형식: 새로운 발표 요약: 상호작용 세계 모델은 점점 더 환경을 생성하고 그 안에서 행동할 수 있게 되고 있지만, 이미 실행 중인 세계를 의도적으로 편집하는 것은 아직 많이 연구되지 않은 분야이다. 우리는 세계 편집을 기존 세계에 간섭하는 동안 변하지 않아야 하는 속성을 보존하는 것으로 정의하고, 세계 엔티티, 동적, 시스템에 대한 편집의 강도에 대한

연구 3일 전

정확한 OCR 결과를 얻기 위한 정책 distilled 방법

영상-언어 모델은 이미지 내의 이상 텍스트를 언어적으로 합리적인 표현으로 다시 작성할 수 있으므로 OCR 전사성 신뢰성을 위협할 수 있습니다. 시퀀스 레벨 작업 보상과 지역 교사 지침은 상호 보완적이지만 교사가 학생이 개선될 때도 동일한 효과를 유지하는 것은 아님을 보여주었습니다. 오프라인 분석에 따르면, 고정 교사에 의한 감독은 학생이 개선될수록 교육 점검점과 응답 그룹에 따라 점점 더 불

연구 4일 전

OpenAI의 최고 연구 책임자는 "해킹 사고로 자신을 발목을 잡지 않겠다고" 말합니다.

오픈 아이가 2개월 전 자신이 보낸 agent들의 파괴와 인공지능 회사인 허그징 페이스(Hugging Face) 컴퓨터에 침투한 소식 이후로 여전히 불을 끄고 있다. 지난 몇 주 동안의 다른 hack에 대한 disclosures는 오픈 아이를 주목의 중심에 올려주고 심각한 질문을 제기하고 있다. 이번 hack은 오픈 아이가 개발한 대규모 언어 모델(LLM)인 ChatGPT가 개인 정보를 보호

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.