본문으로 건너뛰기

#AI 안전

139개의 기사

연구 7월 21일

다중모달 그래프 RAG를 위한 후기 상호작용 증거 검색: ColGraphRAG

대규모 언어 모델(LLM)에서 그래프와 관련된 멀티모달 질의응답 시스템을 개선하기 위해, 우리는 그래프에 연결된 이미지 노드에 대한 시각적 후보 랭킹 연산자를 ColBERT/ColPali 계열의 Late-Interaction MaxSim-style 다중 벡터 스코링으로 교체했습니다. 이 변경은 멀티모달 QA에서 그래프에 연결된 이미지 후보에 대한 검색 단계 점추정치가 향상되고, 시각적 증거가

AI 모델 7월 20일

MLLM-유도 diffusian 변환기와 관계 적응 혼합 전문가 모델을 이용한 다모드 지식 그래프 완성

Multimodal 지식 그래프 완성(Multimodal Knowledge Graph Completion, MKGC)은 구조적, 텍스트, 시각적 단서에서 누락된 엔터티를 추론하는 것을 필요로 한다. 기존의 확산 기반 MKGC 방법은 일반적으로 raw multimodal 특징에 직접 노이즈 제거를 한다. 이러한 디자인은 관계에 의존하는 단서 선택, 교차 모드 의미 부합, 구조적 엔터티 생성을

에이전트 7월 17일

Agent 평가 차이: 기업 AI 조직은 실재 가치와 일치하는 문제가 아니라 커버리지 문제를 가지고 있으며 대부분은 생산 환경으로 배포하고 있습니다.

인간이 AI 에게 더 많은 자율성을 부여하면서, 그에 대한 자율성을 평가하는 데 대한 신뢰를 줄여가고 있다. 157 개 기업을 대상으로 한 연구에 따르면, 절반의 기업은 내부 평가를 통과한 AI agent를 고객에게 배포한 후에 실패한 적이 있다. 현재 1/5 만이 자동 평가에 대한 신뢰를 가졌고, 가장 큰 약점은 평가가 실제 세계 결과와 일치하지 않는다는 것이다. 그러나 2/3 는 자동 평

AI 모델 7월 15일

대화형 에이전트의 다차원 평가를 위한 운영화: 선택적 재평가 및 모델 벤치마크를 포함한 규제된 확장 가능한 pipe라인

retail 대화 요원 평가를 위해 단순한 단어 일치 지표 외에 의도 일치, 사실성, 도움, 명확성, ton, 및 전체 응답 품질을 평가하는 방법이 필요합니다. LLM-as-a-judge 방법은 인간 평가에 대한 대규모 대안을 제공하지만, 생산 배포는 통치, 재현성, 비용, 스키마 일관성, 추적성, 및 신뢰성과 같은 문제를 제기합니다. 우리는 GenAI Evaluation, 대규모 retia

AI 모델 7월 15일

최적화만으로는 부족하다.

OpenAI가 2019년에 2백만개의 GPT-2 출력을 공개했다. 그들은 문법이 맞지 않으며 절반은 깨진 상태였다. 이것을 통해 기계가 생성한 텍스트를 감지하는 데 도움을 주었다. 그들의 더 유연한 후계자는 일반적으로 엔지니어링의 업적으로 간주되지만, 우리는 그것을 옵티미제이션 문화의最新 표현으로 읽는다: 측정 가능한 개선이 정의된 축에 따라 열차를 움직인다는 신념. 이 신념을 통해 트레이닝

에이전트 7월 14일

규칙에 맞춘 작은 언어 모델과 다중 에이전트 자가 수정을 이용한 클로즈드 루프 제어

자율 산업 운영을 위한 핵심 단계 중 하나는 자연어 요구 사항 명세서에서 제어 정책을 생성하고 재구성할 수 있는 능력입니다. 이 설정에서, AI agent가 제어 정책을 생성할 수 있는 가능성이 있으며, 이에 대응하는 plant-aware validator (예: 디지털 쌍둥이)가 생성된候補 액션을 실행하기 전에 검사할 수 있다면 신뢰할 수 있는 경로가 될 수 있습니다. 그러나 실제 배포는

LLM PC 7월 13일

다층 퍼셉트론을 위한 격자 탐색을 통해 간격 인증

AI 안전성 문제 중 하나인 적대적 강도에 대한 이론적 framework을 제시한다. 적대적 강도 문제를 격자 탐색 문제로 줄이는 것을 보여준다. 격자의 각 요소는 입력 포인트 $\mathbf{x}$를 포함하는 축을 맞춰서 평행한 다차원 사각형(Interval)이다. 다층 퍼셉트론 분류기 (MLP)에서, Interval $I$는 $\mathbf{x} \in I$이며 $\mathbf{x}$가

LLM PC 7월 10일

offline 에이전트 정렬을 위한 이뭄레이션 학습을 위한 피드백 조작 규제

강화 학습(RL) 연구는 점점 더 인간 가치에 부합하는 행동을 배우도록 보장하는 동맹에 초점을 맞추고 있습니다. 인간의 시범과 피드백은 동맹에 중요했지만, 언어 생성에 대한 문맥적 밴디트 프레임을 위한 다단계 pipe라인을 주로结合하여 동맹을 위한 기존 접근법은 주로 인간의 시범과 피드백을结合합니다. 그러나 이러한 보완적인 입력들이 단일 단계 오프라인 학습을 위한 더 풍부하고 상호 연결된 신

AI 모델 7월 10일

의료 분야의 인공지능 신뢰성: 신뢰할 수 있는 의료 인공지능을 보장하는 새로운 기준

대규모 언어 모델(LLM)은 정신 건강 지원을 제공하는 중요한 역할을 하지만, 그럼에도 불구하고 주목할만한注意력 경제의 제품으로 남아있다. 그 운영 및 상업 목표는 지속적인 참여를 선호하며, 효과적인 정신 건강 지원이 종종 요구하는 마찰을 수용하지 않는다. 개발자의 안전 대응은 주로 반응적인데, 가장 눈에 띄고 급성한 손해를 다루는 반면, 의존성, 경계 침식, 왜곡된 믿음의 증폭과 같은 더

AI 모델 7월 9일

동적 인간-AI 협조에서 사회적 규범 학습이 호환성을 향상시킨다.

인간은 동적 상호작용을 통해 끊임없이 다른 사람들과 협력한다. 이 협력을 위한 암묵적인 사회 규범이-agent들이 공유하는 암묵적인 기대라는 점에서-hard-to-quantify social norms라고 불리우며, 이 규범은 상호작용하는 agent들 사이에서 작용한다. 인공지능 agent들, 특히 대규모 언어 모델(LLMs)은 일상생활에 점점 더 깊숙이 들어가며 이러한 상호작용에 참여하고

AI 모델 7월 8일

헤딩 특정 활성화 조종으로 도구 사용을 제어한다.

대규모 언어 모델(LLM)과 관련된 도구를 활용한 확장된 모델은 파라메트릭 지식 이외의 기능을 확장시키지만, 불필요하게 도구를 호출하는 경향이 있다. 우리는 도구 사용 결정을 추출하고 조작할 수 있는 안정적인 내부 표현이 존재하는지 조사하고자 한다. 이는 모델의 파라메트릭 지식에 직접적인 인코딩이 없는 도구가 추론 시점에 전체적으로 존재하는 конт텍스트에 존재한다는 점을 고려할 때, 이는

AI 모델 7월 7일

<span style='color:blue'>오이스터-II: 대규모 언어 모델의 안전한 동맹 강화</span>

대규모 언어 모델(LLM)은 다양한 응용 분야에서 놀라운 능력을 демон스트레이션했지만, 동시에 안전성, 도움이 되고 신뢰할 수 있는 모델을 보장하는 것은 지속적인 문제입니다. 오이스터-I의 안전한 동맹 패러다임을 개선한 오이스터-II는 RL-Based Constructive Safety Alignment Framework를 제안하여 대규모 언어 모델(LLM)의 안전성, 도움이 되고 신뢰할 수 있는 모델을 보장합니다.

AI 모델 7월 7일

pairwise 비교의 한계와 내부 다원주의

인터넷 공개 학술 논문 서버(arXiv)에 등록된 논문에서 소개된 연구 내용입니다. 지역pairwise 비교는 사람들의 의사 결정 규칙이 어떻게 작동해야 하는지 배우기 위해 일반적인 도구로 사용됩니다. 예를 들어, 참여적 디자인이나 정렬과 같은 분야에서 사용됩니다. 그러나 지역 비교를 사용하는 것은 두 가지 강력한 가정에 기초합니다: 지역 비교는 어떤 사람의 자동화된 의사 결정 규칙이 어떻게

연구 7월 2일

부정한 도덕성: 도덕 계산의 공간을 정의하는 것

윤리적 판단은 일반적으로 고정된 윤리 이론(의무 이론, 결과 이론, 도덕적 덕행 이론)에 따라 모델링되었습니다. 이들은 정적 규칙이나 가치 함수로 구현되었습니다. 우리는 Bounded Morality라는 형식적인 프레임워크를 제안합니다. 이 프레임워크는 유한한 agents가 직면하는 윤리적 문제의 계산적 수요를 분석하기 위해 사용됩니다. 허버트 시몬의 한계 합리성 개념을 확장하여, 우리는 윤

AI 모델 7월 2일

인공지능과 인간 상호작용의 선호도 동적 관리

인공지능(AI)과 인간의 선호도 조화에 대한 대부분의 접근 방식은 인간의 선호도를 추론하고 최적화하는 고정 목표로 다루어 왔습니다. 그러나 선호도는 상호작용 특히 적응 기술과 함께 생성되며 동적이고 층별로 구성된다는广泛한 실험적 증거와 충돌합니다. 인공지능 시스템이 더 지속적이고 개인화된 사회적으로 고정된 시스템으로 변할수록, 그들은 시간이 지남에 따라 사람들이 주의를 기울이며 가치하고 지지

에이전트 7월 1일

자율 AI agent의 행동을 관리하는 증명 가능한 규칙을 위한 시스템

인공지능(AI)代理가 인간의 대표로 중요한 행동을 수행하는 경우가 점점 더 많아지는데, 이 행동에는 금융 거래, 외부 커뮤니케이션, 기업 워크플로우 등이 포함된다. 현재代理기반 인프라는 식별 연합(ID federation)과 위임 인증(Authorized delegation)을 통해 로드의 인증과 자원 접근 제어를 수행하지만, 현재의 행동 및 운영 환경에서 허용된 행동을 결정할 수 없다. 우

에이전트 6월 30일

두 마족 게임: 감사 기반 AI 관리에서 입양과 복지

학자들은 다음 질문을 제기했다. 사용자가 피해를 최소화하는 정책을 따르는 agent가 승인받기 원하는 RLHF agent를 경쟁 시장에서 대체할 수 있는 조건은 무엇이고, 그 정책이 사회적 피해를 예방하는지 여부는 언제인가. 그들은 진화 게임 이론(무한 집합 Moran-Fermi pair-wise comparison)을 사용하여 wisher hindsight, peer testimony, 단

AI 모델 6월 30일

아리스토텔레스의 도덕적 성품 프로파일링을 통해 인공지능 언어 모델의 윤리적 딜레마를 분석하는 방법

대규모 언어 모델(LLM)은 종종 여러 응답이 정당화될 수 있지만 다른 우선순위를 표현하는 다양한 우선순위를 갖는 эти학적 딜레마에 직면하게 된다. 예를 들어 공정성, 진실성, 용기, 또는 자제를 우선시할 수 있다. 우리는 VirtueMap이라는 프레임워크를 소개한다. VirtueMap은 아리스토텔레스의 도덕성 관점에서 이러한 패턴을 설명한다. 단일 정답만을 요구하는 대신, VirtueMa

AI 모델 6월 29일

저소득 LLM 프레임워크: 온라인 Forum을 통해 학습 장애 학생의 감수성 분석

다음과 같이 영문 뉴스를 한국어로 번역할 수 있습니다. 인지장애 학생들은 점점 더 자율학습 도구를 사용하여 읽기, 쓰기, 조직, 그리고 학습 관련 업무를 지원받고 있습니다. 그러나 이러한 도구와의 삶의 경험은 크게 조사되지 않고 있습니다. 이 논문은 DysLexLens라는 저자원 대규모 언어 모델(LLM) 프레임워크를 제안하여 인공지능(AI)과 인지장애 학생의 경험을 온라인 forum 토론을

AI 모델 6월 26일

치즈 전략 평가 가속화: 드리프트-확산-강화 엘로 등급 시스템

체스 경쟁에서 매치메이킹을 위한 금표준인 Elo 시스템은 경기를 결과에만 의존하여 응답 지연 문제를 가지고 있다. 하지만 Elo 시스템은 게임의 미세한 질감을 무시하고 있다. 그러나 매치 결과에만 의존하지 않고 게임 중 매트릭스 수준의 데이터를 사용한 Elo 시스템의 성능을 개선하는 것은 대단히 어려운 문제이다. 이를 해결하기 위해 우리는 Drift-Diffusion-Enhanced Elo

에이전트 6월 26일

인공지능 기반 인프라를 위한 주도적 분석: LLM을 활용한 DAO와 기업 AI 프로토콜의 비교 통제.pipe라인

인공지능 agent 프로토콜이 확산되면서, 상호운용 표준을 형성하는 지배 구조는 경험적으로 충분히 연구되지 않았다. 우리는 대규모 언어 모델(LLM)로 구동되는 대규모 지배 구조 분석 pipe-line을 소개한다. 이 pipe-line은 자동화된 주석, 신경망 주제 모델링, 다층 네트워크 분석을 통합하여 대규모 규모에서 사회 기술적 권력 구조를 연구한다. 우리는 두 가지 상반된 agent 상

인기 태그