본문으로 건너뛰기

정확도와 비용만 고려하지 말고 지연 시간을 고려한 동적 워크로드를 위한 LLM 쿼리 라우팅

AI 자동 생성

최신 언어 질의 라우터는 질의를 각 모델에 할당하여 반응 품질과 금전적 비용을 균형에 맞게 향상시켜 추론 효율성을 개선한다. 그러나 현재의 질의 라우터는 대다수가 지연 시간에 무관하고 모델 인스턴스에서 질의가 경험하는 생성 지연 시간을 고려하지 않는다. 실제로 지연 시간은 모델 정확도나 추론 비용을 고려하지 않고 라운드 로빈이나 가장 짧은 대기열에 합류하는 정책과 같은 로드 밸런싱 정책으로 제어된다. 모델 정확도나 추론 비용을 고려하지 않고 지연 시간을 라우팅하는 것은 어려울 뿐만 아니라 질의의 프롬프트 길이만큼 아니라 현재 모델 인스턴스의 prefill 및 decode 작업 부하 및 서비스 프레임워크의 스케줄링 및 배치 정책에 따라 지연 시간이 결정되기 때문이다. 우리는 서비스 프레임워크에서 autoregressive token batch 처리를 시뮬레이션하여 질의의 TTFT(시간-첫 번째 토큰)을 예측하는 가벼운 지연 시간 추정기를 설계했다. 이 지연 시간 추정기를 latency-aware 라우터에 통합하여 지연 시간, 정확도 및 비용을 동시에 최적화하여 질의를 모델 인스턴스로 할당한다. 실험 결과, 이 동시 최적화는 표준 로드 밸런싱 접근법의 동일한 지연 시간을 유지하면서 정확도-비용 유틸리티를 40%까지 향상시킨다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.