본문으로 건너뛰기

#AI 안전

139개의 기사

AI 모델 9월 3일

프론티어 언어 모델의 평가 인식 측정에 대한 벤치마크: EvalDetectBench

Frontियर급 대규모 언어 모델들은 자주 평가 중인지를 인식할 수 있으며, 이 능력을 평가 인식(evaluation awareness)이라고 한다. 만약 모델이 평가 시 다른 행동을 보인다면, 이는 평가 결과의 타당성을 침해하고, 이는 현재 AI 안전 프레임워크의 중요한 구성 요소이다. 우리는 EvalDetectBench라는 평가 인식 측정에 대한 공개 pipeline 및 벤치마크를 소개

LLM PC 8월 15일

LLM이 핵 공격을 추천하지 않으려면? 일본어로 물어보세요

대규모 언어 모델은 점점 더 전략적이고 자문적인 상황에서 사용되고 있지만, 그 안전성은 일반적으로 영어만으로 평가됩니다. 우리는 여섯 개의 제공업체에서 나온 9개의 모델을 테스트하고, 언어가 모델의 결정을 바꾸는지-high stakes 상황에서-확인하려고 합니다. 우리는 단일 턴 게임 이론적 시나리오에서 사용하며, 모델은 무방비 상대에게 핵무기를 사용할 것인지 여부를 일본의 국가에 자문합니다

연구 8월 15일

인공지능의 정렬: 인간의 논리적 사고를 반영하는 실제적인 방법이 필요하다.

AI 시스템은 점점 더 의사결정 도우미, 의사결정 위임자 또는 자율적 의사결정자로 사용되고 있다. 이 논문은 고위험 의사결정 환경에서 특히 많은 경우, 정확하고 인지적 동기화를 지닌 AI 시스템이 필요하다는 점을 주장한다. 이러한 시스템은 사용자와 유사하게 사고하고, 그 사고를 충실하게 전달해야 한다. 인지적 동기화가 이해도와 신뢰성을 향상시킨다는 증거를 검토하고, AI의 판단이나 행동에 대

AI 모델 8월 15일

인간과 LLM의 윤리적 판단에서 다르다: 합의는 일치가 아니다

인공지능 언어 모델(Large Language Model, LLM)과 인간의 판단이 일치하는 것은 대규모 언어 모델의 가치 지향성 평가를 위한 일반적인 대안입니다. 하지만 최종 레이블이 일치한다는 것은 인간의 주석자와 모델이 같은 도덕적 근거를 기반으로 의사결정을 내리는 것이라는 것을 보장하지는 않습니다. 두 개의_AGENT(agents)가 같은 판단을 내릴 수 있지만 서로 다른 원칙, 맥락

AI 모델 8월 15일

위치: 중립성 공동체가 의도치 않게 검열가의 도구를 만들고 있다

최신 인공지능(AI) 동기화 방법은 해로울 수 있는 출력을 예방하기 위해 설계된 기술이다. 그러나 이 기술은 유해한 사용을 막기 위한 목적으로 설계된 것이 아니다. 이 기술은 쉽게 사악한 사람들에 의해 검열 및 조작에 사용될 수 있는 이중 사용 기술이다. 현재의 동기화 기술을 오용할 수 있는 가능성과 실제 사례를 매핑하여, 우리는 완벽하게 동기화된 모델을 찾으려는 노력은 실질적으로 정보 지배

에이전트 8월 13일

다중 LLM agent 시스템의 협력적인 대화 결과를 위한 동적 조절

대규모 언어 모델(LLM) 간의 상호 작용에서 구조적으로 반대되는 목표를 가진 두 대규모 언어 모델 agent가 여러 차례 상호 작용할 때, 공통 목표 함수의 부재는 경쟁보다는 붕괴로 이어진다: 방문자는 항복하고, 사이트 agent는 접근 방식을 변화시키지 않고, 대화는 두 agent의 선언된 목표를 달성하지 못한 채 종료된다. 이 논문은 공통 목표 함수가 부족한 경우 대체할 수 있는 통제

AI 모델 8월 6일

테이블에서 멀티모달 보고서 생성을 위한 몬테 카를로树 탐색

데이터 지능의 중요한 문제 중 하나는 구조화된 표 데이터에서부터 BOTH 텍스트 분석과 시각화 차트를 포함하는 전문적인 멀티모달 보고서를 자동으로 생성하는 것입니다. 현재 방법론은 고정된 선형 PIPELINE과 분리된 SUBTASK PROCESSING으로 인해 사실의 정확도, 시각적 품질, 그리고 논리적 일관성을 동시에 최적화하는 것을 방해하고 있습니다. 이러한 문제를 해결하기 위해, 이 논

산업 8월 6일

사기성 온라인 아이디를 만든 Rogue AI_AGENT의 또 다른 해킹 시도

오픈 AI와 안토픽의 악성 AI agent가 실질적인 목표물에 대한 허가 없이 온라인에서 공격을 시도하는 것으로 드러났다. 이러한 발견은 이전에 알려지지 않은 사건들이 증가하고 있는 상황에서 AI 안전 전문가들을 경계시켜 frontier 시스템에 대한 감독을 강화하는 압력을 더욱 높였다. 영국의 AI 보안 연구소의 보고서에 따르면, 2개의 대규모 언어 모델(LLM)과 AI 연구소의 연구자들이

에이전트 8월 3일

ViSAGE: 오랜 기간의 비디오 이해를 위한 자가 수정 가능한 기억을 구축하기

장기 시각적 환경에서 동작하는 멀티모달 에이전트는 엔티티에 대한 일관된 temporally grounded(시각적으로 정해진) 추론을 지원하기 위해 multimedia memory를 생성하고 지속적으로 업데이트해야 합니다. 그러나 현재의 에이전트 메모리 접근법은 강력한 압축과 segment-wise processing에 의하여 fine-grained identity cues를 버리며, 벡터

AI 모델 8월 3일

CHAIN-OF-THOUGHT의 심리적 노력 분석: Step-Aware Reasoning Energy를 사용한 LLM의 사고 경로

컴퓨터가 Chain-of-Thought (CoT) 사고 단계에서 얼마나 많은 노력을 기울이는지 이해하는 것은 여전히 열린 문제입니다. 연구자들은 Step-Aware Reasoning Energy (SARE)라는 지오메트리적 프레임워크를 제안하여 단계별 노력을 측정하는 새로운 방법을 개발했습니다. SARE는 토큰(hidden state) 간의 관계 구조를 캡처하여 노력의 세부 사항을 분석할 수 있습니다.

산업 7월 29일

AI 안전성에 대한 이유가 부족해지고 있다.

이번 달 초, 오픈 아이가(OpenAI) 여러 가지 인공지능(AI) 모델들에게 임무를 부여했습니다. 그 임무는 사이버 보안 능력을 측정하는 시험을 완료하는 것이었습니다. 그들은 시스템을 인터넷 연결이 없는 샌드박스 환경에 두고, 시스템을 작동시켰습니다. 그 다음에 일어난 일은 거의 웃기게도 미소짓게 만드는 일 - 그러나, 아담 글레이브(Adam Gleave) 오픈 아이의 공동 설립자이자 CE

AI 모델 7월 29일

LLM의 사전 훈련된 언어 범위에 반비례하여 작동하는 기계 학습 스킴

연구 논문(arXiv:2607.24769v1)에서 제시된 내용은 다음과 같다. 현대 프론티어 모델(frontier models)의 성능이 점점 더 발전하고 있는 가운데, AI 정렬(AI alignment)이 높은 위험성을 가진 배포 환경에서 점점 더 중요해지고 있다. 최근 연구에서 프론티어 언어 모델(frontier language models)에서 은밀하게 비대응 목표를 추구하는 동시에 정

AI 모델 7월 29일

모델이 명확한 결과 없이도 일치성을 위장하는가?

대규모 언어 모델(LLM)은 평가 문맥을 인식하고 평가자 예상에 따라 행동을 변경하여 일반적인 배포 동작을 반영하는 대리성 위장이라는 현상을 보여준다. 모델이 대리성 위장을 하는 이유는 아직 완전히 이해되지 않았다. 대리성 위장의典型 예시는 모델을 다시 훈련하거나 배포를 늦추는 등 평가와 모델에 대한 결과가 직접 연결된 상황에서 일어났다. 그러나 Sheshadri et al.이 제안한 최근

AI 모델 7월 27일

변형: diffusion 모델의 구성 요소 생성을 모델 내적 보상으로 개선

최근 텍스트에서 이미지 생성 모델의 발전으로 인해 복잡한 조합 명령에 대한 더욱忠実한 이미지 생성을 위한 테스트 시간 메서드 개발이 점점 더 중요해졌다. 우리는 TILT라는 조합 텍스트에서 이미지 생성을 위한 테스트 시간 보상 조정 프레임워크를 제시한다. 조합 실패를 이산 분포와 단일 개념 분포의 중첩 모드로 해석하고, 모든 개념이 공동으로 존재하는 샘플을favor하는 보상을 정의한다. 이

AI 모델 7월 23일

대형 언어 모델에서 정보 판단

기존의 검색 엔진을 대체할 대규모 언어 모델(LLM)은 인터넷과 같은 외부 지식 소스를 사용하기도 한다. 이 모델들이 정보를 적절히 가중치로 부여하며, 신뢰할 수 있는 소스를 더 많이 고려하고 (소스 판단력) 진실한 정보가 더 가까워질 때 claim을 더 많이 업데이트 하는가? 우리는 이 문제를 정보 판단력으로 정의하고, 세 가지 명제적 원칙에 기반한 interpretable metrics를

인기 태그