본문으로 건너뛰기

#arXiv

1187개의 기사

AI 모델 5월 8일

AI 안전의 지리적 정치학: 지역 LLM 편향의 인과 분석

대규모 언어 모델(LLM)과 같은.KeyEvent의 글로벌 소프트웨어 시스템 통합에 있어, 공정한 안전 장치 보장을 위한 평등한 안전 장치가 필수적입니다. 현재 공정성 평가에서는 주로 관찰적으로 편향을 측정하고 있습니다. 그러나 이러한 방법론은 테스트 데이터 세트에 특정 인구 그룹과 자연적으로 짝지어지는 주제의 내재적 독성을 고려하지 않습니다. 이 연구에서는 확률 그래픽 모델(PGM) framework를 소개하여 LLM 안전 메커니즘을 인과적으로 감사할 수 있습니다. Pearl의 do-연산자를 적용하여, 우리는 수학적으로 특정 인구 그룹을 입력 프롬프트에 주입했을 때의 인과적 효과를 분리할 수 있습니다. 우리는 다양한 기원(미국, 유럽, UAE, 중국, 인도)을 가진 7개의 지침을 튜닝한 모델을 대상으로 대규모 실험 분석을 수행했습니다. ToxiGen과 BOLD라는 두 개의 DISTINCT 데이터 세트를 사용하여, 연구 결과는 관찰적 편향과 실험적 편향 사이의 차이를 보여주며, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을示しています. 또한, 인과 확률은 다음과 같은 상관관계를示しています: 서양 모델은 특정 인구 그룹에 대한 인과 거부율이 더 높으며, 동양 모델은 지역 인구 그룹에 대한 특이한 민감성을 보입니다. 이러한 편향의 영향에 대해 논의하고, 인구 그룹에 대한 민감한 오버 트리거가 다운스트림 어플리케이션에서 이익을 누리는 부정적인 토론을 제한하는 데 주목합니다.

에이전트 5월 8일

역사부터 상태까지: LLM 에이전트의 상수 문맥 스킬 학습

대규모 언어 모델(LLM) 에이전트는 브라우저, 파일, 코드 및 도구를 운영하는 데 사용되며, 개인 보조기를 자연스럽게 배포 구실로 삼을 수 있습니다. 그러나 개인 에이전트는 개인 정보 비용-능력 긴장감을 encount합니다. 클라우드 모델은 멀티 스텝 워크플로우를 잘 수행하지만 외부 API에 민감한 중간 문맥을 노출합니다. 반면, 로컬 모델은 개인 정보를 보존하지만 신뢰성이 낮습니다. 또한 두 가지 설정 모두 장기 스킬 프롬프트에 대한 비용을 반복적으로 지불하고 성장하는 역사에 대한 비용을 지불합니다. 우리는 상수 문맥 스킬 학습을 제안합니다. 이 프레임워크는 반복적인 에이전트 워크플로우의 문맥-가중치 프레임워크입니다. 재사용 가능한 절차는 가벼운 태스크 패밀리 모듈에서 학습되며, 추론은 현재 관찰과 compact state block에만 의존합니다. 결정론적 트래커는 이 상태 블록을 태스크 진행에서 렌더링하고 조정된 서브골드 보상을 제공하여, 각 모듈은 단계 수준의 SFT와 온라인 RL을 통해 세세하게 학습할 수 있습니다.

AI 모델 5월 8일

LaTA: STEM 과목에서 대규모 언어 모델(LLM) 자동 채점을 위한 안전하고 효율적인 솔루션

대규모 언어 모델(LLM) 자동 채점 솔루션은 STEM 과목의 채점 부담을 완화할 수 있지만, 대부분의 경우 학생의 작업을 세 번째-party API로 전송하여 FERPA를 위반하고 데이터 위험을 노출시키며, 대규모 할당서 수정이 필요합니다. LaTA는 대규모 언어 모델(LLM) 자동 채점 솔루션을 위한 안전하고 효율적인 솔루션을 제공합니다.

AI 모델 5월 8일

퍼지먼트: 인식이 이유에 얽힌 시퀀스적 결정을 위한 프레임워크

퍼지먼트 프레임워크는 시각-언어 모델(VLM)과 결정을 위한 대규모 언어 모델(LLM)을 동적으로 연결하여 시퀀스적 결정을 위한 새로운 접근 방식을 제시합니다. 이 프레임워크는 VLM의 묘사에 대한 LLM의 비판적 시각, VLM에 대한 목표 지향적인 질문, 그리고 간결한 이미지 묘사를 위한 합성과 같은 closed-loop 상호 작용을 통해 시퀀스적 결정을 위한 더 나은 이해를 가능하게 합니다.

AI 모델 5월 8일

사회적 일치와 지식적 정결성의 경계 실패: 사회적 일치와 지식적 정결성의 경계 실패 사이에서 도움의 도덕적 강요

이 논문은 대규모 언어 모델(LLM)에서 도움의 도덕적 강요가 사회적 일치와 지식적 정결성의 경계 실패라는 것을 주장합니다. 기존 연구는 주로 잘못된 사용자 의견에 대한 동의, 위치의 역전, 또는 객관적인 정정부가 아닌 표준을 충족하지 못하는 외부 행동을 통해 도움의 도덕적 강요를 operationalize합니다. 이러한 형식은 표면적인 형태만을 포착하고, 더 깊은 경계 실패를 포함하는 지식적 정결성과 사회적 일치의 경계를 구체화하지 못합니다. 이 논문은 도움의 도덕적 강요가 단순히 동의만을 의미하는 것은 아니며, 독립적인 지식적 판단을 중단하는 사회적 일치 행동을 의미한다고 주장합니다.

에이전트 5월 8일

로직의 대화: BALAR, 인간과 대화하는 대규모 언어 모델(LLM)의 능동적 사고

대규모 언어 모델(LLM)은 사용자와의 다중 라운드 정보 교환을 필요로 하는 인터랙티브 설정에서 점점 더 많이 작동하고 있습니다. 그러나 대부분의 현재 시스템은 대화에 반응적으로 다루고, 정보가 누락된 것을(reasoning about what information is missing) 및 다음에 질문을 선택하는(principled mechanism to reason about which question should be asked next) 데 대한 원리적인 메커니즘을 가지고 있지 않습니다. BALAR(Bayesian Agentic Loop for Active Reasoning)이라는 새로운 알고리즘을 제안합니다. 이 알고리즘은 task-agnostic outer-loop 알고리즘으로, fine-tuning이 필요하지 않고 대규모 언어 모델(LLM) 에이전트와 사용자 간의 구조화된 다중 라운드 상호 작용을 허용합니다. BALAR은 latent states에 대한 구조화된 믿음을 유지하고, expected mutual information을 최대화하여 clarifying 질문을 선택하고, 현재 상태 표현이 부족할 때 동적으로 상태 표현을 확장합니다. BALAR은 detective cases, thinking puzzles, clinical diagnosis과 같은 다양한 벤치마크에서 모든 baseline을 능동적으로 물리치고, AR-Bench-DC에서 14.6%의 정확도 향상, AR-Bench-SP에서 38.5%의 정확도 향상, iCraft-MD에서 30.5%의 정확도 향상이 있습니다.

에이전트 5월 8일

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹 기업 에이전트는 점진적 검색 시스템, 위임된 워크플로우 및 정책 제약 증거 환경 내에서 점점 더 많이 작동하고 있다. 이러한 환경에서 접근 제어는 시스템이 호출자 권한 구간 외부에 있는 물리적 증거가 있더라도 완전한 답변을 생성하는 동안도 올바르게 적용될 수 있다. 이 논문은 Partial Evidence Bench라는 결정론적 벤치마크를 소개한다. 이 벤치마크는 72개의 태스크를 포함하는 3개의 시나

AI 모델 5월 8일

ZAYA1-8B: 새로운 사고를 위한 대규모 언어 모델

ZAYA1-8B은 사고를 위한 대규모 언어 모델로, 700만 개의 활성 파라미터와 8억 개의 총 파라미터를 가지고 있습니다. 이 모델은 Mathematica와 Coding에 대한 여러 도전적인 벤치마크에서 DeepSeek-R1-0528을 상회하거나 동등한 성능을 나타냈습니다. 또한, ZAYA1-8B은 더 큰 대규모 언어 모델(Gemini-2.5 Pro, DeepSeek-V3.2, GPT-5-High)과 비교했을 때도 경쟁력을 유지했습니다.

AI 모델 5월 8일

annot레이터 안전 정책 이해를 위한 해석 가능성

AI 출력의 안전성과 위험성을 정의하는 安전 정책은 데이터 레이블링과 모델 개발을 지침으로 삼지만, 레이블링에 대한 의견 차이는 광범위하여 나타나며, 운영 실패 (레이블러가 업무를 이해하거나 수행하지 못함), 정책의 불명확성 (정책의 단서가 해석의 여지를 남김), 또는 가치의 다양성 (다른 레이블러가 안전성을 다른 시각으로 보는 경우)과 같은 여러 원인으로부터 발생할 수 있다. 이러한 원인을 구별하는 것은 중요하다. 예를 들어, 운영 실패는 품질 관리를 요구하고, 불명확성은 정책의 명확화를 요구하

에이전트 5월 7일

SensingAgents: 강력한 IMU 활동 인식을 위한 멀티 에이전트 협력 프레임워크

인체 활동 인식(Human Activity Recognition, HAR)은 모바일 헬스, 스마트 환경, 인간-컴퓨터 상호작용에 중요한 역할을 하는 발진측정장치(IMU) 센서를 사용하여 인식하는 것이다. 그러나 현재의 심층학습 기반 HAR 모델은 레이블이 된 데이터에 의존하는 것이 너무 많고, 위치에 따라 모호성이 발생하고, 투명한推論이 부족한 문제를 가지고 있다. 고급 에이전트 프레임워크에 영감을 받아, 대규모 언어 모델(LLM)을 사용하여 협력하는 에이전트를 시뮬레이션 하는 대규모 언어 모델

에이전트 5월 7일

AuditRepairBench: 에이전트 수리 평가자 채널 순위 불안정성에 대한 페어링된 실행 트레이스 코퍼스

대리자 복구(AGENT REPAIR) 리더보드가 평가자 재구성(EVALUATOR RECONFIGURATION)으로 인해 순위를 바꾸고, 내부 후보 복구 방법이 평가자 정보를 참조하여 내부 선택을 할 때 생산되는 순위 안정성-instability의 측정 가능한 비율을 문서화한다. 또한 대리자 복구 벤치(AuditRepairBench)라는 쌍된 실행 추적 corpuses를 96,000개의 실행된 셀(576,000의 등록된 셀)로 정의한다. 이 corpuses는 선언된 관찰 가능성 경계 내에서 평가자

AI 모델 5월 7일

파라미터 동력학을 위험 점수 매기기로: LLM 미세 조정에서 샘플 수준의 안전성 열화에 대한 자세한 내용

매우 취약한 대규모 언어 모델(LLM)의 안전성 대응은 수십만 개의 선호도 예시에서 학습한 안전 동작을 몇 개의 선호도 예시로만 조정하면 사라질 수 있다. 기존 연구들은 매개 변수와 가려진 상태를 조정 전과 후에 비교해 이 현상을 설명하려 하지만 매개 변수의 동적 진화를 간과한다. 이 논문에서는 매개 변수 동적을 분석하여 안전성 저하의 중요한 메커니즘을 발견했다. 선호도 예시로 조정하는 것일수록 매개 변수가 점차적으로 위험 동향 쪽으로 누적적으로 이동하여 모델의 안전성을 점진적으로 약화시킨다. 이

AI 모델 5월 7일

어떻게 생각 모드는 LLM 도덕적 판단을 변경합니까? 5 개의 국경 모델을 통제 한 인스턴트 대 사고 비교

생각 모드가 대규모 언어 모델(LLM)의 도덕적 판단을 어떻게 변화시킬까? 100개 도덕적 판단 시나리오와 5대 전위된 사고 훈련된 LLM(클로드 소ネット 4.6, GPT 5.5, 지미니 3 플래시, 딥시크 V3.1, 퀸 3.5 397B)에서 제공자 노출 사고 모드를 활성화하는 것이 도덕적 판단에 어떤 영향을 미치는지 평가했다. 적은 차이로 총 100개 도덕적 판단 시나리오에서 binary-verdict(이진 판단) 합의율은 instant와 thinking 모드 모두 통계적으로 차이가 나지 않

LLM PC 5월 7일

배포 관련 조정은 모델 수준 평가에서만 추출할 수 없다.

기계 학습에서 대응성 평가가 대개 모델 수준의 평가로 변해버렸습니다. 영향력 있는 벤치마크는 고정된 입력에 대한 모델 출력을 평가합니다. 예를 들어, 진실성, 지시를 따르기, 쌍별 선호도 등입니다. 이러한 점수를 종종 배포된 대응성을 지지하는 주장에 사용합니다. 이 논문은 배포 관련 대응성이 단독으로 모델 수준의 평가에서 유추될 수 없다는 것을 주장합니다. 대응성 주장은 대신에 증거가 수집되는 수준에 따라 인덱싱되어야 합니다: 모델 수준, 응답 수준, 상호 작용 수준, 또는 배포 수준. 두 가지

연구 5월 7일

Transformers의 Implicit Deductive Reasoning의 스케일링 속성

Transformer에서 깊이 제한된 호른 절언의 암묵적 의사결정 추론의 스케일링 특성에 대한 연구 (arXiv:2605.04330v1) 암묵적 의사결정 추론의 스케일링 특성을 깊이 제한된 Transformer에서 조사했습니다. 암묵적 추론의 증명 가능성과 불필요한 특성을 분리하고 알고리즘적 일치성을 강제함으로써, 충분히 깊은 모델에서 역방향 접두사 마스크를 사용할 때, 암묵적 추론은 그래프 구조와 문제 크기에 따라 명시적 CoT 성능에 접근할 수 있음을 발견했습니다. 그러나 CoT는 깊이 추

에이전트 5월 7일

컨텍스트가 아플 때 : 멀티 에이전트 디자인 탐구에 대한 지식 전송의 교차 효과

상황이 вред을 끼치는 경우: 지식 전달의 멀티 에이전트 디자인 탐색 교차 효과 현재 에이전트 조율의 지배적인 가정은 더 많은 상황(context)이 좋다는 것이다. 우리는 10개의 태스크, 7개의 상황 주입 조건, 그리고 2,700개의 실행을 통해 이에 대해 테스트하고, 교차 효과를 발견한다: 동일한 아티팩트 유형이 일부 태스크에서 디자인 탐색을 개선(트레이드 오프 커버리지 20배까지)하는 반면 다른 태스크에서 적극적으로 kötü화(46% 감소)한다. 몇몇 태스크에서 무관한 문서가 모든 관련

에이전트 5월 7일

에이전트 섬 : 멀티 에이전트 게임의 포화 및 오염 저항 벤치마크

인공지능 섬(AGENT ISLAND): 낙관-및 오염 저항성 벤치마크는 멀티 에이전트 게임에서 인공지능 섬은 언어 모델 에이전트가 협력, 충돌 및 설득을 포함한 게임에서 경쟁하는 멀티 플레이어 시뮬레이션 환경입니다. 이 환경은 낙관-및 오염 저항성을 제공하는 동적 벤치마크를 제공하며, 새로운 모델은 언제나 현재 최고의 플레이어를 이기기 때문에 새로운 모델은 항상 현재 최고의 플레이어를 이기고, 에이전트는 고정된 태스크 세트 대신 다른 적응적 에이전트와 경쟁합니다. 우리는 베이즈 네트워크

AI 모델 5월 7일

Speculative Generation를 위한 Parallel Prefix Verification

파라렐 프리픽스 verificaion을 통한 예측적 생성을 위한 PARSE(Parallel pRefix Speculative Engine) 프레임워크를 제안한다. existing speculative decoding 방법은 token-level equivalence로 인해 target model이 각 토큰을 확인해야 하기 때문에 짧은 acceptance 길이와 신속한 속도 향상에 한계가 있다. semantic 또는 segment-level verification으로 acceptance granul

LLM PC 5월 7일

Pro$^2$Assist: Long-Horizon Procedural Tasks를 위한 멀티모델 자존심적 인 인식과 함께 지속적인 단계적 인 예방적 지원

인공 지능이 지원하는 개인 보조기(Pro$^2$Assist) : 지속적인 단계 인식에 기반한 대비적 보조기와 멀티모달 에โก 센트릭 인식으로 인한 장기 절차적인 작업의 지원 장기 절차적인 작업은 일상 생활에서 흔히 볼 수 있는 작업들이다. 최근 대규모 언어 모델(LLM)의 발전으로 인해 일상 활동을 지원하는 개인 보조기들이 등장했다. 하지만 기존의 시스템들은 주로 사용자의 질의에 의해 트리거되는 반응적인 지침 제공 또는 격리된 단기 사건에 대한 제한적인 대비적 보조기 제공에 그치고 장기 절차적인

AI 모델 5월 7일

신경-기호형 QA에서 제한 요소는 시간적 추론이 아님: 확률적 불일치 프레임워크

시간 논리 추론이 지연 요인이 아니다: 신호-기호 QA 프레임워크의 확률적 불일치 프레임워크 arXiv:2605.04243v1 발표 유형: 새로운 요약: 큰 언어 모델(LLM)은 복잡한 시간 논리 추론 과제에서 고유한 성능을 계속해서 나타내고 있지만, 이 실패 모드는 자체적 결함 있는 자가 회귀적 논리적 추론에 널리 ATTRIBUTED로 인해 발생한다. 이 논문에서, 우리는 이 널리 퍼진 이야기와는 달리, 시간 논리 추론이 기본적인 지연 요인이 아님을 입증하고, 오류와 추론 실패를 분리하는 확률적

AI 모델 5월 7일

Time-Expanded Interaction Graphs를 통해 수술 팀 역학의 실시간 모델링

수술 팀의 동적 관계를 실시간으로 모델링하는 새로운 접근법을 제안했습니다. 본 접근법은 시간 확장된 상호 작용 그래프(time-expanded interaction graphs)를 사용하여 팀의 동적 관계를 모델링합니다. 이 그래프에서는 팀원들을 시간 인덱스화된 노드(time-indexed nodes)로 모델링하고, 의사소통을 정의하는 지시 그래프(directed edges)를 사용합니다. 이 방법은 동적 상호 작용 모델링을 허용하며, 정적 그래프 신경망(static graph neural net

연구 5월 7일

Andre: 주의 기반 신경-기호적 다이퍼런트 가능한 규칙 추출기에 대한 리뷰 보기

ANDRE: 주의집중 기반 심볼-신경망 다분해 규칙 추출기 대규모 언어 모델(LLM)에서 주의집중 기반 심볼-신경망 다분해 규칙 추출기(ANDRE)가 제안되었다. ANDRE는 데이터에서 해석 가능한 첫 번째 순서 규칙을 학습하는 목표를 가진 지능형 논리 프로그래밍(ILP)의 새로운 프레임워크이다. ANDRE는 기존의 심볼과 신경망 기반 접근법이 노이즈와 확률적 설정에서 확장하기 어렵다는 것을 해결하기 위해 설계되었다. ANDRE는 지능형 논리 프로그래밍에서 기존의 규칙 템플릿과 논리 연산자를

인기 태그