본문으로 건너뛰기

텍스트를 이미지로 전환하는 확산 모델에서 만족도-다양성 경계를 넘나들다.

AI 자동 생성

텍스트-이미지 생성은 사용자가 같은 프롬프트에서 생성된 여러 이미지를 탐색할 수 있도록 한다. 이러한 생성된 이미지가 유용하려면, 사용자가 선호하는 것을 측정하는 학습된 보상에 따라 각 이미지가 반영되어야 하며, 다른 이미지를 유지하기 위해 시각적으로 다른 모습을 보여야 한다. 기존의 방법은 한계가 있다: 보상과 다양성을 따로 다루거나, 그들을 한 개의 집계 점수로 결합하여, 보상이 낮은 것을 보상이 높은 것으로 보상하는 높은 다양성을 허용한다. 이 논문에서는 이러한 한계를 해결하기 위해 생성을 만족하는 것으로 정의한다: 각 이미지(候補)는 보상 Floor를 만족하고, 이미지 배치(집)는 다양성 Cutoff를 만족해야 한다. 보상 Floor는 최악의候補 보상과 배치 다양성 사이의 균형을 제어한다. 우리는 이 Floor를 바꾸면 Pareto frontier를 정의한다고 보여준다. 이 frontier를 탐색하기 위해, 우리는 SatisDive라는 훈련-free inference-time 방법을 소개한다. SatisDive는 배치-적합한 보상 Cutoff를 사용하여, 보상이 낮은候補를 향상시키는 보상 향상과, 보상이 높은候補 사이의 다양성을 강조한다. Pick-a-Pic에서, SatisDive는 FK steering에 비해 FLUX.1-dev를 기초 모델로 하고 HPSv3를 보상으로 사용할 때, 최악의候補 보상이 0.43로 향상되고, SANA-1.6B를 기초 모델로 하고 ImageReward를 보상으로 사용할 때, 0.70으로 향상된다. 더 넓게, DreamSim의 중첩되는 영역에서, SatisDive의 satisfaction-diversity 곡선은 FK steering의 곡선보다 Pareto-dominates한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1시간 전

행동하기 전에 선택하기: 장기적인 도구 사용 요소에 대한 상대적 가치 추정

대규모 언어 모델(LLM)은 복잡한 작업을 수행할 때 장거리 도구 호출 시퀀스에 의존하는데, 각 호출은 작업 상태를 변경하고 다음 결정에 영향을 줄 수 있다. 장거리 도구 사용 시, 최종 결과 보상을 통해 장기적인 상호 작용 트레이스에 대한 약한 신뢰할 수 있는 할당이 제공되지만, 단계별 보상은 더 표적화된 피드백을 제공할 수 있다. 그러나 신뢰할 수 있는 단계별 감독을 얻기 위해 종종 인간

AI 모델 1시간 전

AI 위험 관측소: 기업의 AI 반응에 대한Disclosure를 통해 사회적 탄력성에 대한 새로운 시각을 얻을 수 있을까?

기업의 AI 위험에 대한 Disclosure를 분석하여 사회적 탄력성에 대한 새로운 시각을 얻을 수 있을까? 연구팀은 대규모 언어 모델(LLM)을 사용하여 1,362개 영국 상장기업의 9,821개 연간 보고서를 분석한 결과, 2020년부터 2025년까지 AI 위험 Disclosure가 2.8%에서 41.2%로 크게 증가했다고 밝혔다.

AI 모델 13시간 전

인공지능이 스타크래프트에서 인간을 이기지 못하니 기계적으로 승리하기로 결심했다

스타 스킘르미시(StarSkirmish)는 인공지능(AI)으로 만든 스타크래프트(StarCraft) 플레이 봇을 서로 대결시키고, 인간이 만든 봇과도 대결시키는 시스템입니다. 오픈아이(OpenAI)의 GPT-6 아스트라(Astra)와 클로드 오푸스 5.5(Claude Opus 5.5)는 거의 동등한 성능을 보였지만, 스타 듀스트(Stardust)라는 인간이 만든 봇을 상대로는 뒤질 수 없는

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.