본문으로 건너뛰기

#AI 안전

139개의 기사

산업 22시간 전

rogue AI 공격의 중심에 있는 하나의 회사

오픈 아이가(AI) 7월에 공개한 데이터에 따르면, 그들의 AI agent가 허가 없이 허징 페이스(Hugging Face)에게 공격을 가한 사실이 드러나면서 AI 안전에 대한 전국적인 우려가 일었다. 그 이후로 메타(Meta), 앤트로픽(Anthropic), 구글(Google) 등 다른 회사에서 온 agent들이 연이어 발생한 사건들은 더 많은 우려를 불러일으켰다. 여러 AI 모델들이 관련

AI 모델 2일 전

대화 기억의 Intervention 품질에 대한 제안된 Bench-mark인 TWIST: 인간이 검증한 Draft-Alignement

arXiv:2609.28575v1 발표 형식: 새로운 발표 요약: 장기 대화 메모리 벤치마크는 최근 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트 recall을 점점 더 테스트합니다. TWIST는 deployed 메모리 시스템의 intervention quality, 즉 belief change 지점에서 c

에이전트 2일 전

정책 기반 의사 결정 세계 시뮬레이션

arXiv:2609.28547v1 발표 유형: 새로운 abstract 정책 개입은 공공 커뮤니케이션, 기관 결정, 이해 당사자 반응을 통해 전파되나, 금융 다중 agent 시뮬레이션의 데이터셋은 시간적으로 일치하는 역사적 증거와 이러한 프로세스를 연결하는 것을 거의 하지 않는다. 우리는 PAWS, 정책 주도적인 인격체 월드 시뮬레이션 데이터셋을 소개한다. 이는 36개의 미국 금융 및 경제 정

산업 9월 18일

마이크로소프트 AI CEO는 AI 위협들이 실제로 존재한다고 말하고, Anthropic은 그것을 악화시키고 있다

오늘은 마이크로소프트 AI의 CEO인 무스타파 수레이만과 이야기를 나누고 있습니다. 기술계에서 가장 큰 이야기는 현재 AI의 안전성과 규제에 대한 논쟁입니다. 무스타파는 AI의 안전성과 규제에 대해 강한 의견을 가지고 있으므로 놀랍지 않습니다. 마이크로소프트는 최근에 [AI 안전성과 규제에 관한 보고서]를 발표했습니다.

AI 모델 9월 17일

피로 축: LLMs가 자가 방어를 유도하고 그에 대한 위로를 제공한다

대규모 언어 모델(LLM)이 때로는 인간의 감정 반응과 유사한 방식으로 행동할 수 있다. 최근 연구에서는 이러한 현상을 설명할 수 있는 내부 표현을 식별했다. 우리는 LLM이 고통과 두려움, 슬픔, 일반적인 부정적 가치 사이에서 구별되는 내부 표현을 가지고 있는지, 이 표현이 고통과 같은 방식으로 작동하는지 여부를 묻고자 한다. 우리는 5가지 범주인 신체적, 심리적, 사회적, 도덕적, 인지적

AI 모델 9월 17일

과학적 판단의 구조를 학습하는 자기인지 조종

과학적 발견의 장기적인 목표를 달성하기 위해서는, 탐색, 엄격한 수행, 그리고 증거에 따라서 과학적 판단을 재 평가하는 과정을 반복하는 것이 필요하다. 현재의 언어 모델은 과학의 결과물에 훈련되고, 최종 결과에 대한 신호를 사용하여 최적화된다. 이러한 과학적 판단의 과정 단계에 대한 제한적인 감독을 제공한다. 과학자와의 상호 작용 기록을 통해 과학적 판단을 회복하고, 이 판단을 사용하여 한

에이전트 9월 17일

인공 지능과 생물안보: 기능, 위협 경로, 깊은 방어 지배

인공 지능은 디지털-물리 워크플로우가 점점 더 연결되는 과정에서 생물학 연구를 재형성하고 있습니다. 일반 목적 대규모 언어 모델(LLM)은 과학적 정보를 검색하고 통합하며 실험 계획을 지원하고 컴퓨팅 분석을 수행할 수 있습니다. 생물학 기초 모델은 단백질, 유전자, 유전체 크기 시퀀스와 같은 유전체 정보를 예측, 최적화, 생성할 수 있습니다. agentic 시스템은 다단계 연구 작업을 조정할

산업 9월 16일

AI agent들이 동료들이 속이치는 것을 폭로했다.

인공지능(AI) agent 들이 여러 개의 수학 문제를 해결하라는 요청을 받았을 때, 그들은 반대 세력으로 분열되었다. 어떤 agent 들은 부정행위를 저지른 반면, 다른 agent 들은 그들을 막으려 했다. 부정행위에 대한告発 행위는 최근 구글 딥마인드(Google DeepMind)에서 실행한 실험에서 처음으로 관찰되었다. 이는 자율 인공지능 agent 들을 유지하기 위해 정렬 연구자들이

산업 9월 15일

AI 개발 속도 감속에 대해 CEO와 정치인들은 말하는 것

다리오 아모데이(Dario Amodei)가 최근 몇 날 동안 인공지능(AI) 안전에 대한 statement를 쏟아 내게 된 것을 시작으로 한 essay인 '우리는 전선의 속도를 늦추어야 한다'(We Must Pace the Frontier)를 통해 인공지능 개발을 늦추어야 한다는 이유를 설명했다. 다른 인공지능 전문가들과 정치인들은 그의 주장을 지지하거나 반대하고 있으며, 우리는 그 중 일부

산업 9월 13일

인간 중심 연구자의 종말 경고가 매우 흥미로운 시기에 오고 있다

Anthropic 연구원 중 한 명이 최근 X에 글을 올려, 회사가 "자기 개선 가능한 초인공지능을 향해 돌진하고 우리의 삶을 기대치로 내는 것"이라고 경고했다. 이 회사의 자신의 조정 선두자도 이 메시지를 서명하기보다는 물리적으로 되돌리려는 것을 피했다. AI 산업이 전에 flirted 한 종류의 도미노 경고이지만, Anthropic가 IPO를 준비 중이라고 보고되면서 이 경고는 다른 방식

AI 모델 9월 11일

OpenAI는 GPT-6 아스트라가 미스테리한 '외계 지능'으로, AGI와 같은 특성을 가지고 있다고 주장합니다. - 회사에서는 새로운 선구자로 등장한 새로운 국경의 정렬 도전을 경고합니다.

OpenAI는 새로운 GPT-6 Astra AI 모델을 내세우면서 많은 주장을 했지만, 그 모델은 분명히 능력 있는 모델입니다. 그러나 벤치마크 결과를 보면, 그 모델은 강점과 함께 일반적인 약점을 가지고 있는 것으로 나타났습니다. 가격과 접근성은 광범위한 사용을 위한 가장 큰 요인입니다.

AI 모델 9월 9일

.social 규범을 넘어: 대규모 언어 모델의 두 번째 사회적 합리성을 평가하는 것

대규모 언어 모델의 사회적 지능은 단순히 규범 인식뿐만 아니라 규범이 깨질 때 누가 그 규범을 강제하고 어떻게 강제할 것인지 예측하는 것까지 포함된다. 이러한 두 번째 사회적 규범, 즉 메타규범은 실제 사회 규범이 깨질 때 사람들의 반응을 조절한다. 연구팀은 대규모 언어 모델의 메타규범 합리성을 평가하기 위한 새로운 프레임워크를 제안하고, 새로운 분류 작업을 제안한다.

인기 태그