본문으로 건너뛰기

#Mistral

14개의 기사

LLM PC 8월 13일

Bayesian 모델 칼리브레이션을 위한 문헌 정보를 기반으로 한 전역 분포 설계

Bayesian 기반의 프로세스 기반 모델의 감리 작업을 위해서는 각 모델의 매개변수에 대한 사전 분포가 필요하다. 많은 연구자들은 이 작업을 수행하기 위해 유니폼 사전 분포를 사용한다. 하지만 유니폼 사전 분포를 사용하는 이유는 이 작업을 수행하기 위한 도메인 지식과 통계 지식이 필요하고, 이를 통해 유의미한 사전 분포를 구축하는 데 시간이 많이 걸린다는 것이다. 우리는 Distribird

AI 모델 8월 4일

스몰 미디어 기업(SME)에서 오류를 줄이기 위한 문맥 특화 지식으로 보강된 LLM: RAG 기반 모델링 및 분석

인공지능(AI) 분야의 하나인 대규모 언어 모델(LLM)이 점점 더 소규모와 중소기업(SME)에서 질문-답변 능력과 기업 의사결정 과정 지원을 위해 채택되고 있다. 그러나 LLM이 생성한 출력물에서 발생하는 환각은 정보 왜곡의 원인이 될 수 있어 SME 내에서 사용자의 신뢰도와 신뢰성을 떨어뜨려 있다. 외부 지식源을 모델링 과정에 통합하는 Retrieval-Augmented Generatio

LLM PC 7월 23일

인텔 TDX 하위 NVIDIA H100에서 신뢰할 수 있는 GPU 추론 성능 측정

기밀 처리는 sensitive한 입력을 처리하거나 사설 모델 자산을 보호하기 위해 AI 인식 작업을 위한 실질적인 배포 요구 조건이 되고 있습니다. 그러나 GPU 가속된 대규모 언어 모델 서비스를 위해 기밀 처리를 활성화하는 성능 비용은 작업 부하에 따라 달라지고 operationally 중요합니다. 이 논문은 NVIDIA H100 80GB GPU를 Intel TDX 기밀 인스턴스에 호스트한

에이전트 7월 21일

마스크드 확산 언어 모델은 강력하고 조정 가능한 텍스트 기반 월드 모델 : 에이전트 RL을 위한 강력한 툴

최근 강화 학습의 성장으로 다양한 환경을 위한 대체 훈련 환경이 필요해졌습니다. 환경을 고정한 태스크와 보상 난이도가 환경 성능이 향상되면 효과적인 신호가 되지 않으며, 장기적인 보상이 희박하면 특정 워크플로우나 도구 구조에 대한 모드 붕괴를 유발합니다. 월드 모델이 환경 상태를 시뮬레이션하는 것은 순수 롤아웃 성능과 동등하게 성능을 보이므로, 다양성 요구 사항을 충족하기 위한 대용량 환경을 구축하는 데 hứ중에 있습니다. 그러나 자동 회귀 (AR) 월드 모델은 전방향 편향으로 인해 전역적으로 상호 의존적인 상태 anchor들, 즉 도구 스키마, 이전 턴, 예상 결과에 대한 조건을 설정하는 것을 방지합니다.

AI 모델 7월 1일

강력한 판넬(LLM) 심사관 집단

대규모 언어 모델(LLM) 심사위원단은 여러 심사위원의 합의 점수를 보고하는 심사위원단(PoLL)의 합의 점수에 대한 합의점을 달성한 심사위원단이 단독 심사위원의 대규모 언어 모델 평가에 대한 실제 대안이 되었지만, 그 통계적 행동은 아직도 잘 이해되지 않았다. 우리는 대규모 언어 모델 심사위원단을 Huber 오염 모델 underneath 에서 formalize하고 PoLL가 positive

AI 모델 6월 5일

다중 테이블 Q&A를 위한 합성 대비적 추론

multi-table 질문에 대한 답변을 위한 모델은 관련된 증거를 검색하고, 스키마를 연결하고, 관계형 테이블에 대한 합성적 추론을 수행해야 한다. 현재 multi-table Q&A 자원은 일반적으로 질문과 최종 답변을 제공하지만, 답변의 유래 설명을 제공하는 합리적 지시가 부족하다. 이 boşNESS를 채우기 위해 우리는 MMQA를 위한 합성 대조적 추론-트레이스 데이터 세트를 구성하기

LLM PC 5월 14일

주의가 닫히는 순간: LLM이 멀티 턴 상호 작용에서 주제를 잃는 이유

대규모 언어 모델(LLM)은 단일 턴에서 복잡한 지시를 따르지만, 장기적인 멀티 턴 상호 작용에서 지시, 인격, 규칙을 잃을 수 있다. 이 감소는 행동적으로 측정되었지만, 기계적으로 설명되지 않았다. 우리는 주제 정의 토큰이 주의의 통로를 통해 더 이상 액세스할 수 없게 되며, 주제 관련 정보는 잔여 표현에서 지속될 수 있다는 채널 전환 설명을 제안한다. 주제 액세스성 비율(GAR)을 도입하여 생성된 토큰에서 목표 정의 토큰으로 주의를 측정하고, 슬라이딩 윈도우 절단 및 잔여 스트림 프로브를 결합한다. 주의가 지시를 닫는 순간, 무엇이 살아남는지가 아키텍처를 드러낸다. 다양한 아키텍처에서 전환은 질적으로 다른 실패 모드를 산출한다: 일부 모델은 주의가 사라지더라도 목표 조건된 행동을 보존하고, 다른 모델은 잔여 목표 정보가 디코딩될 수 있더라도 실패한다. 이 인코딩이 발생하는 레이어는 2에서 27까지 다양하다. 모델 내의 인과적 절단이 Mistral의 주의 통로를 강제로 닫으면, 20개 사실 보존 태스크에서 반환률이 11%에서 거의 완벽한 11%로 떨어지고, 불편한 압력 기반 대조군보다 인격 제약 위반률이 높아지며, 이 모든 효과는 예측 가능한 교차 턴에서 발생한다. 선형 프로브는 Aimed 표현에서 회귀 결과를 회복시키는 AUC가 0.99까지 모든 네 가지 주요 아키텍처에서 0.99까지 달성한다. 입력 임베딩은 기대치에 머물러 있다. 다양한 아키텍처와 모델 규모에서 주의 손실과 잔여 디코딩 가능성의 간격이 목표 조건된 행동이 주의 통로가 닫히는 경우에 살아남는지 여부를 예측한다. GAR를 진단도구로, 채널 전환 프레임워크를 제어된 기계적 설명으로, 윈도우드 주의 닫기로 실패 시간을 예측하는 파라미터 예측을 기여한다.

AI 모델 5월 8일

AI 안전의 지리적 정치학: 지역 LLM 편향의 인과 분석

대규모 언어 모델(LLM)과 같은.KeyEvent의 글로벌 소프트웨어 시스템 통합에 있어, 공정한 안전 장치 보장을 위한 평등한 안전 장치가 필수적입니다. 현재 공정성 평가에서는 주로 관찰적으로 편향을 측정하고 있습니다. 그러나 이러한 방법론은 테스트 데이터 세트에 특정 인구 그룹과 자연적으로 짝지어지는 주제의 내재적 독성을 고려하지 않습니다. 이 연구에서는 확률 그래픽 모델(PGM) framework를 소개하여 LLM 안전 메커니즘을 인과적으로 감사할 수 있습니다. Pearl의 do-연산자를 적용하여, 우리는 수학적으로 특정 인구 그룹을 입력 프롬프트에 주입했을 때의 인과적 효과를 분리할 수 있습니다. 우리는 다양한 기원(미국, 유럽, UAE, 중국, 인도)을 가진 7개의 지침을 튜닝한 모델을 대상으로 대규모 실험 분석을 수행했습니다. ToxiGen과 BOLD라는 두 개의 DISTINCT 데이터 세트를 사용하여, 연구 결과는 관찰적 편향과 실험적 편향 사이의 차이를 보여주며, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을示しています. 또한, 인과 확률은 다음과 같은 상관관계를示しています: 서양 모델은 특정 인구 그룹에 대한 인과 거부율이 더 높으며, 동양 모델은 지역 인구 그룹에 대한 특이한 민감성을 보입니다. 이러한 편향의 영향에 대해 논의하고, 인구 그룹에 대한 민감한 오버 트리거가 다운스트림 어플리케이션에서 이익을 누리는 부정적인 토론을 제한하는 데 주목합니다.

에이전트 5월 1일

대변자 역할 실패: 입증적 제약이 주도하는 LLM 기반 정치 성명 분석에서 대변자 역할 충실도

다양한 평가자 모델이 대립적 역할을 할 때, 다중 에이전트 LLM 파이프라인이 민주적 토론 분석 시스템에서 점점 더 많이 사용되고 있습니다. 이 연구는 TRUST 파이프라인을 사용하여 대변자 역할을 유지하는 것에 대한 기본 가정에 대한 첫 번째 체계적인 실험적 테스트를 제공합니다. 또한 대변자 역할 충실도에 대한 4 가지 지표를 사용하여 60 개의 정치 성명(30 개의 영어, 30 개의 독일어)을 측정합니다.

인기 태그