AI 1건 · 일반 0건
NVIDIA TensorRT-LLM v1.3.0rc25 릴리스는 KV 캐시 관리자 V2를 DeepSeek, GLM, GPT-OSS, Mistral Large, Kimi, MiniMax, Nemotron, Qwen, Gemma 등 다수 모델에 기본 적용한다. KV 캐시 V2는 향상된 확장성과 안정성을 제공하며, 향후 모든 신규 모델에 기본 아키텍처로 자리 잡을 예정이다. 다만, 분산 서빙 시 시작/종료 시 멈춤, Gemma 4 포함 모델 무한 대기, B200 GPU에서의 KV 캐시 V2 스케줄러 충돌 등 알려진 이슈들이 존재한다. TensorRT-LLM 팀은 V1을 점진적으로 V2로 마이그레이션할 계획이다.