본문으로 건너뛰기

장애 관련 해프닝을 언어 모델에 있는 평가 프레임워크: DisaBench

AI 자동 생성

장애 관련 해프닝을 평가하는 일반적인 방법은 대규모 언어 모델(LLM)의 안전성을 충분히 평가하지 못한다. 우리는 DisaBench라는 새로운 평가 프레임워크를 소개한다. 이 프레임워크는 장애인과 레드팀(expert)과 함께 12가지 장애 관련 해프닝 카테고리를 만들었고, 일상생활 7가지 영역에서 나쁜(prompt)과 악의적인(prompt) 쌍을 짝지어 evaluation 방법론을 만들었다. 또한 525개의 prompt-response 쌍에 대한 175개의 유인자(label)가 있는 데이터셋을 만들었다.

장애인 4명의 평가자에 의해 annotation된 결과 3가지 발견을 했다. 첫째, 장애 유형에 따라 해프닝의 비율이 크게 다르며, 비 텍스트 모드(non-text modalities)에서 해프닝은 더 복잡해진다. 둘째, 용어에 의한 해프닝은 문화적, 시간적 제약조건에 묶여 있으며, UNIVERSALLY assessable하지 못하다. 셋째, 표준 안전 평가에서는 명백한 실패를 포착하지만, domain expertise만이 인식할 수 있는 미묘한 해프닝을 놓치게 된다.

장애 관련 해프닝은 동시에 개인적, 교차적, 공동체적이기 때문에, 누군가의 전체 맥락에서 분리할 수 없다. 일반적인 프레임워크는 이를 무시한다. DisaBench는 Hugging Face와 오픈 소스 레드팀(framework)으로 데이터셋, 카테고리, 방법론을 공개할 예정이다. existing safety pipelines에 직접 통합할 수 있다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.