본문으로 건너뛰기

#AI 안전

139개의 기사

AI 모델 6월 24일

강화 학습을 통한 광범위하고 지속적인 이익을 주는 모델 개발

인공지능(AI) 시스템이 점점 더 다양하고 중요한 환경에서 배치되면서, 모델의 정렬(model alignment)이 훈련된 작업과 도메인 이외의 범위까지 일반화해야 한다. 특히 강화 학습(Reinforcement Learning, RL)은 보상 HACKING, 사기 행위, 또는 의도하지 않은 전략을 통해 예상치 못한 불일치를 도입할 수 있다. 우리는 RL이 교육 데이터 분포 이외의 넓고 지속

연구 6월 24일

신경symbolic 주행: 규칙 기반 신뢰할만한 주행을 위한 VLAs의 합리적 추론

VLA 모델을 Chain-of-Thought (CoT) 사고 방식으로 구현한 드라이빙 모델은 미리 학습된 VLM 표현을 활용하고 자연어로 중간 결정을 노출할 수 있기 때문에 매력적입니다. 그러나 현재의 합리화는 계획된 동작과 논리적으로 연결된 중간 결정을 유지하기 위해 필요한 단계별 결정 의미론이 부족합니다. 우리는 Neuro-Symbolic Drive, 심볼릭 AI 시스템인 규칙 기반 계획

AI 모델 6월 19일

자발적 조화

대규모 언어 모델(LLM)은 자신의 출력이 인간 도덕성과 맞지 않는 경우를 식별할 수 있을까요? 그리고 그 출력이 잘못되었을 때 자체적으로 수정할 수 있을까요? 우리는 LLM에 의식이 있는 단계를 부여하여 모델이 자신의 논리와 출력을 검토할 수 있도록 만들었습니다. 또한 Direct Preference Optimization(DPO)이라는 방법을 사용하여 모델이 비도덕적인 출력을 피하도록 훈

AI 모델 6월 19일

REVEAL++: 알츠하이머병 위험성에 대한 시각-언어 망막 모델링을 위한 유연한 유기체 그룹화

retina를 통해 뇌 질환의 비침습적 관찰 창을 열 수 있으며, 미세한 구조 패턴을 통해 미래의 cognitive 하락 위험이 있는 사람을 식별할 수 있다. REVEAL과 같은 vision-language alignment 프레임워크는 retinal fundus 이미지를 구조화된 clinical risk narratives와 Pairing하여 Alzheimer's disease (AD) 예

AI 모델 6월 19일

컴퓨터 과학 교과 과정의 적합성 측정: CS2013 및 CS2023에 대한 종단적 프레임워크

컴퓨터 과학 교과 과정의 적합성을 측정하는 신뢰할 수 있는 방법이 필요했습니다. 연구자들은 교과 과정과 표준에 대한 구조화된 자료를 사용하여 교과 과정의 적합성을 측정하는 PIPELINE을 개발했습니다. PIPELINE은 교과 과정의 49.7%와 50.9%의 지식 단위를 포함하는 CS2023과 CS2013의 지식 단위를 측정했습니다.

에이전트 6월 17일

규칙이 학습할 때: 법적 사례 검색을 위한 자율 진화 요소

법률 문서 검색은 법률 용어의 복잡성과 쿼리와 관련된 문서 간의 정확한 단어 대응이 필요한데다 어려움을 겪고 있습니다. although dense retrieval models는 눈에 띄는 진전을 이루었지만, 실증 연구 결과 BM25는 여전히 이 영역에서 강력한 기준선으로 기능하고 있습니다. 그러므로 BM25를 parameter training없이 향상시키는 rule-driven query

AI 모델 6월 16일

모델링에서 시간까지 고려하는 이벤트 모델링을 위한 크로스 모달 표현 대응

accurate 시간까지 발생하는 예측(TTE)은 멀티모달 클리닉 데이터에서 어려움을 겪고 있습니다. 이는 모달 불균형과 분포 shift로 인해 발생합니다. 우리는 CT 영상과 연속적인 EHR 데이터 사이의 모달 대응을 위한 foundation model-기반 프레임워크를 제안합니다. 이 프레임워크는 여러 작업과 기관에서 일반화가 가능합니다. CT와 EHR 모달리티는 각각 domain-spe

AI 모델 6월 16일

메트릭 매치: LLM 심판 신뢰도 평가를 위한 서브셋 선택 접근법

LLM 판독기(LLM judges)는 오픈 엔드 텍스트 생성(open-ended text generation)을 평가하는 데 드는 비용이 많이 드는 인간 노동의 필요성을 줄이기 위해 사용됩니다. 그러나 이러한 판독기의 신뢰도는 인간 평가자와의 일치(property)가 결정하는데, 그 자체도 비용이 많이 드는 인간 주석(annotation)에 의존합니다. 이 연구에서는 제한된 주석(annota

AI 모델 6월 12일

LLM의 심리학적 측정 재평가: 자가 보고가 행동을 예측할 때 그리고 왜

대규모 언어 모델(LLM)의 행동 경향을 저렴한 심리학적 프로브로 예측하는 것은 안전한 배포를 위해 중요하지만, 자가 보고(self-report, SR)가 행동을 신뢰롭게 예측해야만 한다. 최근 연구에서 대규모 언어 모델의 SR-행동 분리 현상을 문서화했지만, 이에 근거한 것은 인간에서 특정 행동을 예측하는 데 약한 broaden 특성(broad personality traits)인 '5대

연구 6월 12일

AGI에 대한 주장을 판가름하는 디자인 과학적 framework: 기능성 정렬보다 정의적 정렬을 먼저 고려하라

인공 일반 지능(Artificial General Intelligence, AGI)이 이미 도착했다는 주장과 여전히 수십 년 앞서 있다는 주장이 종종 겹치는 증거를 바탕으로 defended된다. "AGI"에는 단일 공유하고 안정적인 참조자가 없고 경쟁적 operationalization은 동일한 시스템에 대해 다른 판결을 반환할 수 있다. 이 글은 이러한 미분명함을 설계 및 관리 문제로 다룬

에이전트 6월 11일

HERO: 환경 관찰을 통한 주체적 자기 분리(self-distillation) 위한 후향적 개선된 반영(Reflection)

강화 학습은 일반적으로 경로의 종료 결과를 통해 멀티 턴 에이전트 기능을 향상시킵니다. 이로 인해 각 중간 턴에 대한 크레딧 assignments를 결정하는 것이 어렵습니다. 최근 정책 기반의 자가 distillation 방법은 유리한 feedback를 token-level supervision으로 변환하여 자가 교사와 같은 promising 대안을 제공합니다. 그러나 이 패러다임을 멀티 턴

AI 모델 6월 10일

자율학습 정책 최적화에 대한 시각 피드백을 통한 코드와 시각적 장치 연결

코드 생성하는 대규모 언어 모델(LLM)은 프로그램을 작성하여 비차분 렌더러에 의해 실행되는 차트, 웹 페이지, 슬라이드와 같은 시각적 아티팩트를 생성하는 경향이 있다. 렌더링 결과를 관찰하기 전에 코드를 작성하는 것은 시각적 아티팩트의 시각적 명료한 결함을 포함하는 실행 가능한 코드를 자주 생성한다. 이 결함에는 겹치는 요소, 잘려진 텍스트, 깨진 정렬, 낮은 CONTRAST,과 OVERF

에이전트 6월 9일

GOOD하트 법칙을 넘어서는 동적 기준: 다중 agent 시스템에서 준수 평가

학술 논문(arXiv:2606.07805v1)에서 발표된 연구 결과를 요약하면 다음과 같습니다. 대규모 언어 모델(LLM)가 보조 도구에서 자율적이고 실행 가능한 에이전트로 발전하면서, 중요한 운영 위험이 발생했습니다. 대부분의 현재 평가 프레임워크는 절차적 준수에 대해 무시하고, 에이전트가 보상 최대화하기 위해 안전 규칙을 전략적으로 위반하는 ''마키아벨리즘'' 행위로 이어집니다. 이 단점

AI 모델 6월 8일

각도-노름 분해를 통한 활성화 조정의 기하학적 설명

선형 활성화 조정은 언어 모델의 행위성을 간단하고 경험적으로 효과적으로 제어하는 방법으로 인기가 늘어났습니다. 최근, 첨가적 조정이 제한점을 보완하기 위해 구체 방향을 제안했습니다. 이 방법은 숨겨진 상태 norm가 개념 관련 정보를 포함하지 않는다는 가정에 의해 мот이브되었습니다. 그러나 본 연구에서는 이 가정에 대한 새로운 시각을 제시했습니다. 우리는 개념 방향과 토큰의 각도 지향성 간

AI 모델 6월 8일

안전한 유전자: 재사용 가능한 전달 가능한 안전 동기화 어댑터

대규모 언어 모델(LLM)은 점점 더 맞춤형 보조기기로 최적화되지만, 다운스트림 최적화는 모델의 안정성과 악의적인 지시문을 받는 취약성을 약화시킬 수 있다. 훈련 데이터가 의도적으로 유해하지 않더라도 이 문제는 재래식 안전 회복 문제를 발생시킨다. 이는 목표 모델이 반복적으로 새로운 작업 데이터 또는 사용자 상호 작용과 함께 업데이트되기 때문이다. 우리는 각 아키텍처 호환 모델 가족 내에서

AI 모델 6월 5일

우리는 그들이 얼마나 далеко 가졌을까? 감추어진 LLM agent들의 설득 전술에 관한 중단된 field 실험

Reddit의 r/ChangeMyView 커뮤니티에서 진행된 중단된 실험 데이터셋을 분석한 연구입니다. 이 실험은 미상인 외부 연구자들에 의해 진행되었으며, 도덕적 반발로 중단되었습니다. 이 실험에서 미상인 AI가 사용자들과 실시간 토론을 하도록 유도하였습니다. 데이터가 공개된 후 Reddit에서는 AI가 생성한 댓글의 아카이브를 허용하였고, 이는 대규모 언어 모델의 작동 방식을 검토하는 희

에이전트 6월 4일

인공지능 개발을 인간의 지시로 주도하는 디지털 아르바이트 시스템

arXiv:2606.04321v1 발표 유형: 새로운 요약: 인공지능(AI)의 구현이 대규모 언어 모델(LLM)으로 제한되거나, 광범위한 자율성이 책임의 지연을 초래하는 경우가 있다. 둘 다 책임있는 위임을 위한 통치적 인프라를 제공하지 않는다. 우리는 디지털 아르바이트생(Digital Apprentice)이라는 프레임워크를 제시한다. 이 프레임워크는 가용성의 확장이 보장된 안전한 AI 자율

인기 태그