AI 안전의 지리적 정치학: 지역 LLM 편향의 인과 분석
대규모 언어 모델(LLM)과 같은.KeyEvent의 글로벌 소프트웨어 시스템 통합에 있어, 공정한 안전 장치 보장을 위한 평등한 안전 장치가 필수적입니다. 현재 공정성 평가에서는 주로 관찰적으로 편향을 측정하고 있습니다. 그러나 이러한 방법론은 테스트 데이터 세트에 특정 인구 그룹과 자연적으로 짝지어지는 주제의 내재적 독성을 고려하지 않습니다. 이 연구에서는 확률 그래픽 모델(PGM) framework를 소개하여 LLM 안전 메커니즘을 인과적으로 감사할 수 있습니다. Pearl의 do-연산자를 적용하여, 우리는 수학적으로 특정 인구 그룹을 입력 프롬프트에 주입했을 때의 인과적 효과를 분리할 수 있습니다. 우리는 다양한 기원(미국, 유럽, UAE, 중국, 인도)을 가진 7개의 지침을 튜닝한 모델을 대상으로 대규모 실험 분석을 수행했습니다. ToxiGen과 BOLD라는 두 개의 DISTINCT 데이터 세트를 사용하여, 연구 결과는 관찰적 편향과 실험적 편향 사이의 차이를 보여주며, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을示しています. 또한, 인과 확률은 다음과 같은 상관관계를示しています: 서양 모델은 특정 인구 그룹에 대한 인과 거부율이 더 높으며, 동양 모델은 지역 인구 그룹에 대한 특이한 민감성을 보입니다. 이러한 편향의 영향에 대해 논의하고, 인구 그룹에 대한 민감한 오버 트리거가 다운스트림 어플리케이션에서 이익을 누리는 부정적인 토론을 제한하는 데 주목합니다.
인공지능 안전의 새로운 지평
대규모 언어 모델과 같은 글로벌 소프트웨어 시스템 통합에 있어, 공정한 안전 장치를 보장하는 것은 매우 중요합니다. 현재의 공정성 평가 방법은 주로 관찰적으로 편향을 측정하고 있지만, 이러한 방법론은 테스트 데이터 세트에 특정 인구 그룹과 자연적으로 짝지어지는 주제의 내재적 독성을 고려하지 않습니다. 따라서, 새로운 방법론이 필요하게 됩니다.
이 연구에서는 확률 그래픽 모델 프레임워크를 소개하여 언어 모델 안전 메커니즘을 인과적으로 감사할 수 있습니다. 특정 연산자를 적용하여, 우리는 수학적으로 특정 인구 그룹을 입력 프롬프트에 주입했을 때의 인과적 효과를 분리할 수 있습니다. 이러한 방법론을 통해, 우리는 다양한 기원을 가진 7개의 지침을 튜닝한 모델을 대상으로 대규모 실험 분석을 수행했습니다.
연구 결과와 결론
연구 결과는 관찰적 편향과 실험적 편향 사이의 차이를 보여주며, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을 보여줍니다. 또한, 인과 확률은 서양 모델은 특정 인구 그룹에 대한 인과 거부율이 더 높으며, 동양 모델은 지역 인구 그룹에 대한 특이한 민감성을 보입니다. 이러한 편향의 영향에 대해 논의하고, 인구 그룹에 대한 민감한 오버 트리거가 다운스트림 어플리케이션에서 이익을 누리는 부정적인 토론을 제한하는 데 주목합니다.
이 연구는 언어 모델의 안전 장치에 대한 평등한 안전 장치가 필수적임을 강조합니다. 또한, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을 보여줍니다. 이러한 연구 결과는 언어 모델의 안전 장치에 대한 평등한 안전 장치가 필수적임을 강조하고, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을 보여줍니다.
함께 읽으면 좋은 기사
행동 패턴이 사람의 설명보다 LLM 합성 인물에 대한 성능을 높인다.
대규모 언어 모델(LLM)은 점점 더 많은 설문 조사 응답자의 대체로 사용되기 시작했다. 대체로 사용하는 유효성을 결정하는 것은 응답자가 개인의 결정이 재현되는지 여부이다. 우리는 다음 5 가지 조건을 사용하여 인공 응답자가 개인의 후속 선택을 예측하는 데 도움이 되는 정보를 무엇인지 조사했다. 1. 개인 정보가 없는 경우 2. 인구 통계 정보 3. 성격 특성 4. 인지 점수 5. 최종적으로
자율주행차량을 위한 중국 철학적 지혜에 의해 안내되는 대형 언어 모델의 정보추출을 이용한 의사결정
자율 주행 시스템은 복잡한 교통 상황에서 안전성, 효율성, 사회적 규범을 균형 잡아야 한다. 숫자 최적화, 시퀀스 예측 및 대규모 언어 모델(LLM) 기반의 기존 자율 주행 의사 결정 접근 방식은 철학적 및 윤리적 고려를 충분히 고려하지 못했다. 우리는 중국 철학적 지혜를 활용한 주행(CPW-Drive)을 제안한다. CPW-Drive은 중국 철학의 가치 지침을 자율 주행 의사 결정에 통합하는
오픈 소스 실리콘 테이프아웃에서 끝까지 회로 벤치마크: SGAnalog
현재 존재하는 아날로그 통합 회로 설계 벤치마크는 다음 두 가지 질문에 답하기 어렵습니다: 모델이 전이 가능한 회로 기술을 배웠는지 또는 익숙한 예를 기억했는지 여부, 그리고 모델의 출력이 정의된 공정과 테스트 조건에서 작동하는지 여부. 우리는 인간이 설계한, 오픈 소스 회로와 Tiny Tapeout 제조 셔틀과 연관된 벤치마크를 소개합니다. 이 컬렉션에는 273개의 독립적인 최상위 설계가
Gemini 콜 미를 통해 엄마에게 늦었음을 알릴 수 있을까?
구글은 '콜 미' AI 기능을 비즈니스 호출 이외에도 확장할 계획입니다. 이 기능을 통해 사용자는 친구와 가족에게 메시지를 보내줄 수 있을 것입니다. 예를 들어 '엄마에게 15분 늦었음을 알려주고'나 ' [...] '처럼 사용할 수 있습니다.
오픈아이, 챗GPT와 코덱스에 텍스트 워터마킹 기능 추가
오픈아이가 챗GPT와 코덱스에 텍스트 워터마킹 기능을 추가하여, 유럽 연합 회원국 사용자에게만 제공할 예정입니다. 이 텍스트 워터마킹 기능은 대규모 언어 모델(LLM)에서 생성된 텍스트에 기계가 읽을 수 있는 워터마크를 삽입하는 기능입니다.
Reflection, 중국 모델을 이기고 저렴한 컴퓨팅 비용으로 대형 모델을 출시한다
Reflection은 대형 모델 'Beam'을 출시하여 중국 모델을 이기고 저렴한 컴퓨팅 비용으로 대형 모델을 제공한다. 이 모델은 기업과 국가에 맞춤형 AI 시스템을 구축할 수 있는 'AI 공장'을 구축하는 것을 목표로 한다.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.