AI 2건 · 일반 0건
Audio8 ASR은 네이티브 스트리밍 아키텍처를 통해 초당 12.5회의 디코딩 성능을 제공한다. 롤링 KV 캐시는 24/7 운영에서도 메모리와 지연 시간을 일정하게 유지시킨다. 클럭 스텝당 하나의 텍스트 토큰을 생성하여 인지 세분성과 자원 비용 사이의 균형을 맞춘다. ML 인턴이 HuggingChat에 Gradio 워크플로우를 설정하여 테스트를 진행했다.
Nvidia GPU 환경에서 Strata 추론 엔진이 llama.cpp 포크들을 능가하는 놀라운 속도를 보여준다. 12GB VRAM과 64GB RAM을 갖춘 노트북에서도 Qwen3.8 모델을 초당 50토큰(TG)과 1500토큰(PP)으로 실행한다. 개발자는 초기 버그를 신속하게 수정하며 엔진 완성도를 높였다. 로컬 LLM 환경에서 추론 속도 향상을 원하는 사용자에게 Strata는 주목할 만한 대안이 된다.