AI 기술 블로그, API 튜토리얼, 업계 소식
프리필(Prefill)과 디코딩(Decode) 단계를 분리하여 대규모 언어 모델의 추론 비용을 획기적으로 관리하고 성능을 높이는 새로운 아키텍처, Dual-Flow Transformers를 소개합니다.