본문으로 건너뛰기

가변 분산 LLM 서비스를 위한 SLO-Aware Prefill-Decode 분산된 모델 제공을 위한 인-플레이스 탄성성

AI 자동 생성

대규모 언어 모델(LLM) 서비스를 위한 Prefill-decode 분리 아키텍처는 두 가지 다른 실행 패턴과 서비스 수준 목표(SLO objectives)가 있는 두 단계를 분리하는 데 사용되는 일반적인 아키텍처가 되고 있다. 기존 시스템은 일반적으로 고정된 Prefill/decode 작업자 비율과 요청 라우팅을 통해 작업자를 결합한다. 그러나 실제 세계 작업로드는 Prefill-to-decode 수요 비율에서 짧은 폭발과 지속적인 Shift를 모두 나타낸다. 결과적으로, 특정 시간에 잘 프로비전된 구성이 빠르게 불일치하여, 다른 곳에 비어있는 idle capacity에도 불구하고, 지연 시간 SLO 위반이 발생한다. 기존의 autoscaling 기법은 capacity를 추가할 수 있지만, 느리게 반응하고 spare GPU가 필요하며, 짧은 시간尺계의 phase 불균형을 직접 해결하지 못한다. FluidPD라는 P/D 분리된 서비스 시스템을 제시한다. FluidPD는 두 가지 보완적인 기법을 제공한다. FluidToken은 decode-side slack가 있는 경우 decode 작업자에 Prefill 계산의 한정된 부분을 오프로딩하여 transient 불균형을 처리한다. FluidRole은 Prefill 및 decode 역할 사이에서 실행 중인 작업자들을 place에서 재assign하여 모델 reload 및 엔진 restart를 피한다. 이 두 기법은 가볍고 가벼운 압력 지표를 통해 Prefill 및 decode-side 자원 압력을 노출한다. 이는 지연 시간 SLO 위반이 나타나기 전에 나타난다. Azure 생산성 트레이스 작업로드에서 FluidPD는 정적 SGLang보다 전체 SLO 달성을 향상시켜 최대 94.6%를 나타내며, 추가 작업자를 프로비전하지 않고도 서비스 품질을 향상시키는 SLO-aware in-place P/D 탄력성을 보여준다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 2시간 전

게임개발 에이전트를 위한 합성 경로를 실세계 자산에 부착한 게임 개발 교육

최근 대규모 언어 모델(LLM)의 성능 향상은 웹 프론트 엔드 실행 capability를 보여주었고, 브라우저 기반 게임 생성이 특히 눈에 띄는 전선이 되었다. 이전 연구는 복잡한 다중 턴 워크플로우나 정적 게임 평가 벤치마크에 집중하는 등, 게임 개발을 위한 직접적인 엔드 투 엔드 실세계 게임 합성을 위한 노력은 있었다. 그러나 게임 개발을 위한 간단한 사용자 쿼리에서 복잡한 게임을 생성하

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.