AI 3건 · 일반 2건
swyx가 새로운 프로팁을 공개한다. 모델 증류 기법을 에이전트 허네스에도 적용 가능하다는 것이다. 이는 복잡한 에이전트 시스템의 효율성을 높이고, 특정 작업에 최적화된 경량 에이전트 구축의 가능성을 열어준다. 복잡한 에이전트의 기능을 더 작고 빠르게 만들어 배포 효율성을 높이는 방법론으로 볼 수 있다.
DeepSeek는 최근 V4-Flash 업그레이드를 발표했으며, Terminal-Bench 점수가 56.9에서 82.7로 상승했다. 이는 +25.8점의 큰 폭으로 증가한 것이다. 현재 이 업그레이드는 API를 통해만 사용할 수 있지만, 곧 오픈 웨이트가 공개될 예정이다. 이 업그레이드는 DeepSeek의 성능을 크게 향상시킬 것으로 기대된다. DeepSeek의 새로운 점수를 통해 개발자들은 더 나은 성능을 기대할 수 있다. 또한, 이는 AI 기술의 발전에 기여할 것으로 보인다.
DeepSeek-V4-Flash-0731 모델이 벤치마크에서 이전 Pro 버전을 크게 앞서는 성능을 보인다. Flash 버전은 더 나은 효율성과 속도로 동일하거나 더 우수한 결과를 제공한다. 이는 LocalLLaMA 커뮤니티에서 주목받는 소식이며, 로컬 환경에서의 모델 성능 향상을 기대하게 한다. 개발자들은 이전 Pro 버전을 대체할 강력한 옵션을 얻게 된다.
vLLM Kunlun은 Kunlun XPU에서 vLLM을 구동하기 위한 커뮤니티 유지 플러그인이다. RFC Hardware Pluggable 원칙을 따라 vLLM과 Kunlun XPU 통합을 분리하여 유연성을 높였다. 최신 릴리스는 Qwen3.5, Gemma4, GLM MoE DSA 등 다양한 모델과 DFlash 스펙큘러 디코딩을 지원한다. 또한, MoE 모델과 소형 배치에 대한 성능 최적화, DeepSeek-V3.2 MTP 지원, 새로운 양자화 기법(W4A16, AWQ MoE W4A16, W8A8) 및 CI/CD 파이프라인 개선이 포함되었다.
젠스파크가 신용카드 크기의 하드웨어 녹음기를 만들었다. 녹음, 텍스트 전환, 요약은 이미 스마트폰으로 충분히 가능하지만, 업무용 에이전틱 AI를 만드는 소프트웨어 회사가 이 하드웨어를 내놓은 이유는 인터랙션 비용과 회의실 대화를 메모리에 넣는 데 있었다. AI 워크스페이스 6.0 미디어데이에서 공개된 내용과 함께 젠팀을 써본 경험을 정리했다. 젠스파크의 녹음기는 업무 환경에서 효율성을 높일 수 있는 도구로 보인다. 녹음 품질이 아닌 인터랙션 비용과 결정이 실제로 내려지는 회의실 대화를 메모리에 넣는 데 중점을 둔 점이 특징이다. 젠스파크의 이 도전은 업무 환경에서 AI를 활용한 새로운 가능성을 열어준다.