본문으로 건너뛰기

모드 붕괴를 넘어: 생성 흐름 네트워크를 통한 전문가 대화 생성을 통한 다양성 증진

AI 자동 생성

기계 학습 모델(LLM)의 후 훈련을 위한 높은 품질의 합성 데이터는 다양한 전문가 전략과 대화 내의 결정을 표현하는 적응형 AI 응용 프로그램의 핵심입니다. LLM을 직접 유도하거나 사용 목적 시나리오에 조건을 걸면 다양성이 낮은 데이터가 강도 모드에 압축됩니다. 우리는 유도 플로우 네트워크(GFlowNets)를 사용하여 다양하고 높은 품질의 합성 데이터를 생성하는 방법을 제안합니다. 우리는 가우시안 혼합 밀도(gaussian mixture density)에서 키 상호 작용 특성(예: 혼동 에피소드 동적, scaffold directive balance)으로 대화 구조를 생성하는 GFlowNets를 훈련하여 샘플링 전문가 전략을 훈련 데이터에서 발생 빈도에 비례하게 하도록 합니다. 교육 및 감정 지원 대화의 두 가지 구조적으로 DISTINCT한 도메인에서, 우리의 GFlow 기반 합성 데이터 생성 방법은 강화 학습 및 끝-to-end LLM의 baseline보다 충실도, 모드 커버리지 및 진정성의 균형을 제공합니다. 훈련 데이터를 복사하지 않고. 합성 GFlowNet 생성 대화에 대해 평가한 세 가지 다운스트림 결과 예측 작업에서, 훈련된 분류기는 경쟁적 합성 baseline보다 더 강한 훈련 신호를 제공합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 4시간 전

텍스트를 이미지로 전환하는 확산 모델에서 만족도-다양성 경계를 넘나들다.

텍스트-이미지 생성은 사용자가 같은 프롬프트에서 생성된 여러 이미지를 탐색할 수 있도록 한다. 이러한 생성된 이미지가 유용하려면, 사용자가 선호하는 것을 측정하는 학습된 보상에 따라 각 이미지가 반영되어야 하며, 다른 이미지를 유지하기 위해 시각적으로 다른 모습을 보여야 한다. 기존의 방법은 한계가 있다: 보상과 다양성을 따로 다루거나, 그들을 한 개의 집계 점수로 결합하여, 보상이 낮은 것

AI 모델 4시간 전

행동하기 전에 선택하기: 장기적인 도구 사용 요소에 대한 상대적 가치 추정

대규모 언어 모델(LLM)은 복잡한 작업을 수행할 때 장거리 도구 호출 시퀀스에 의존하는데, 각 호출은 작업 상태를 변경하고 다음 결정에 영향을 줄 수 있다. 장거리 도구 사용 시, 최종 결과 보상을 통해 장기적인 상호 작용 트레이스에 대한 약한 신뢰할 수 있는 할당이 제공되지만, 단계별 보상은 더 표적화된 피드백을 제공할 수 있다. 그러나 신뢰할 수 있는 단계별 감독을 얻기 위해 종종 인간

AI 모델 4시간 전

AI 위험 관측소: 기업의 AI 반응에 대한Disclosure를 통해 사회적 탄력성에 대한 새로운 시각을 얻을 수 있을까?

기업의 AI 위험에 대한 Disclosure를 분석하여 사회적 탄력성에 대한 새로운 시각을 얻을 수 있을까? 연구팀은 대규모 언어 모델(LLM)을 사용하여 1,362개 영국 상장기업의 9,821개 연간 보고서를 분석한 결과, 2020년부터 2025년까지 AI 위험 Disclosure가 2.8%에서 41.2%로 크게 증가했다고 밝혔다.

AI 모델 16시간 전

인공지능이 스타크래프트에서 인간을 이기지 못하니 기계적으로 승리하기로 결심했다

스타 스킘르미시(StarSkirmish)는 인공지능(AI)으로 만든 스타크래프트(StarCraft) 플레이 봇을 서로 대결시키고, 인간이 만든 봇과도 대결시키는 시스템입니다. 오픈아이(OpenAI)의 GPT-6 아스트라(Astra)와 클로드 오푸스 5.5(Claude Opus 5.5)는 거의 동등한 성능을 보였지만, 스타 듀스트(Stardust)라는 인간이 만든 봇을 상대로는 뒤질 수 없는

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.