본문으로 건너뛰기

노이즈가 있는 경찰 음성 데이터에 대한 미리 학습된 ASR 가짜 레이블링

AI 자동 생성

방송 경찰 통신(Broadcast Police Communication, BPC)에서 노이즈가 많은 상황에서 훈련된 음성 인식 시스템이 나쁜 성능을 보인다. 이를 통해 경찰의 의사 결정이 이해될 수 없게 되고, 이는 경찰의 의사 결정에 대한 연구를 어렵게 만든다. 사용자 레이블을 비용이 많이 들지 않고 pseudo-labeling을 통해 ASR 성능을 개선할 수 있는 방법이 있다. 그러나 매우 노이즈가 많은 도메인에서 pseudo-labeling의 효용성은 알려져 있지 않다. 본 연구에서는 Baltimore와 Chicago의 BPC 도메인 데이터 셋에 대한 foundation ASR 모델(Whisper와 Qwen3-ASR)가 pseudo-labeling을 통해 노이즈가 많은 BPC 도메인 데이터 셋에 적응하는 방법을 검토한다. 내부 신뢰도 지표(로그 확률 및 STAR 점수)가 노이즈가 많은 BPC의 pseudo-label의 질을 구분하지 못한다는 것을 보여주고, external LLM-as-a-judge 필터링 패러다임을 소개한다. 이 패러다임은 parametric 지식을 사용하여 문맥적으로 불가능한 전cribe를 필터링한다. LLM-judging 필터는 내부 지표보다 더 공격적으로 필터링을 하며, Baltimore와 Chicago의 BPC 데이터 셋에 대한 pseudo-labeled 학습 셋의 WER를 줄인다. 그러나 oracle 필터와 비교하여 여전히 큰 격차가 남아 있다. 또한, 한 모델이 다른 모델의 pseudo-label을 사용하여 fine-tuning하는 cross-model pseudo-labeling 패러다임을 소개한다. 본 연구에서는 이 패러다임이 향후 pseudo-labeling 연구의 새로운 방향으로 될 수 있음을 제안한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 46분 전

단백질 확산 모델의 테스트 시점 정렬을 위한 스펙트럴 피드백

Reward 최적화와 일치하는 방법을 위한 분산 확산 모델의 방법론은 대개 역과정의 방향을 조절하기 위해 로짓을 영향받거나 중간 단계에서 선호하는 시퀀스를 선택하는 것을 목표로 합니다. 이러한 접근법은 주로 추론을 단방향적인 과정으로 다루며, 불쾌한 토큰 선택을 재방문하는 메커니즘을 제공하지 못합니다. 우리는 Spectral Feedback 라는 알고리즘을 소개합니다. 이 알고리즘은 feed

AI 모델 46분 전

3차원 구조 기반의 막통합 단백질의 상위 구조 예측

이 논문은 최신 그래프 신경망(GNN, Graph Neural Network)인 SchNet을 이용한 단백질拓종 추론의 새로운 방법을 제시한다. 모델은 최근 DeepTMHMM 모델을 개발하기 위해 사용된 데이터셋과 동일한 데이터셋을 사용하여 5-분할 교차 검증을 통해 학습되었다. 단백질 서열이나 $\alpha$- 탄소만을 특성으로 사용하는 전통적인 접근법과 달리, 우리는 분류기에서 모든 원자

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.