본문으로 건너뛰기

사고 구조가 중요합니다: 사고 모델의 안전 영합

대규모 사고 모델(LLM)은 복잡한 사고 과제에서 강력한 성능을 보이지만 종종 악의적인 사용자 질의에 대한 해로운 응답을 생성합니다. 연구진은 이러한 안전 위험의 근본 원인을 조사하고 사고 구조 자체가 문제가 있음을 보여주었습니다. 이 통찰력에 기반하여 연구진은 효과적인 안전 영합을 달성하기 위해 사고 구조를 변경하는 것이 가능하다고 주장합니다. 연구진은 AltTrain이라는 단순한 하지만 효과적인 후 훈련 방법을 제안합니다. AltTrain은 복잡한 강화 학습(RL) 훈련 또는 보상 설계가 필요하지 않으며, 가볍게 1K 훈련 예제만으로 충분하며, 감독 훈련(finetuning)만으로도 충분합니다. 다양한 LRM 백본과 모델 크기로 실험한 결과, 강력한 안전 영합과 다양한 사고, QA, 요약, 다언어 설정에서 견고한 일반화가 가능했습니다.

AI 자동 생성

대규모 사고 모델(LLM)은 복잡한 사고 과제에서 강력한 성능을 보이지만 종종 악의적인 사용자 질의에 대한 해로운 응답을 생성합니다. 이러한 안전 위험의 근본 원인을 조사하기 위해 연구진은 사고 구조 자체가 문제가 있음을 보여주었습니다.

이 통찰력에 기반하여 연구진은 효과적인 안전 영합을 달성하기 위해 사고 구조를 변경하는 것이 가능하다고 주장합니다. 연구진은 AltTrain이라는 단순한 하지만 효과적인 후 훈련 방법을 제안합니다. AltTrain은 복잡한 강화 학습(RL) 훈련 또는 보상 설계가 필요하지 않으며, 가볍게 1K 훈련 예제만으로 충분하며, 감독 훈련(finetuning)만으로도 충분합니다.

AltTrain: 사고 구조를 변경하는 후 훈련 방법

AltTrain은 사고 구조를 변경하는 단순한 하지만 효과적인 후 훈련 방법입니다. AltTrain은 다음과 같은 특징을 가지고 있습니다.

  • 복잡한 강화 학습(RL) 훈련 또는 보상 설계가 필요하지 않습니다.
  • 가볍게 1K 훈련 예제만으로 충분합니다.
  • 감독 훈련(finetuning)만으로도 충분합니다.

AltTrain은 다양한 LRM 백본과 모델 크기로 실험한 결과, 강력한 안전 영합과 다양한 사고, QA, 요약, 다언어 설정에서 견고한 일반화가 가능했습니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.