AI 4건 · 일반 0건
중국 Tencent가 770B 파라미터, 49B 활성 파라미터, 1M 토큰 컨텍스트 창을 가진 Hy4 Preview를 공개했다. 이는 이전 모델 Hy3 대비 상당한 규모 확장이다. Hy4는 텍스트 입력 전용 LLM으로, 거대 언어 모델 시장 경쟁에 새로운 활력을 불어넣는다. 공개된 chat_template.jinja는 모델의 추론 방식에 대한 힌트를 제공한다.
에이전트 개발에서 모델과 하네스의 분리는 핵심 원칙이다. 이는 특정 LLM 모델에 종속되지 않는 유연한 아키텍처 구축을 지향한다. 하네스는 에이전트의 로직, 도구 연동, 워크플로우 제어를 담당하며 모델은 추론 기능만 수행한다. 이 설계 덕분에 개발자는 모델을 자유롭게 교체하고 다양한 환경에 쉽게 적응시킨다. 벤더 종속성 회피로 장기적인 확장성과 유지보수성이 확보된다.
Sebastian Raschka가 저서 "Build a Reasoning Model (From Scratch)" 관련 라이브 Q&A를 진행한다. 이 책은 "Build a Large Language Model (From Scratch)"의 후속작으로, LLM의 추론 및 후처리 스케일링에 집중한다. 독자들은 두 책의 연관성을 포함하여 저자에게 직접 질문할 기회를 얻는다. AI 모델의 추론 능력 향상에 관심 있는 개발자에게 유익한 시간이 된다.
최근 출시된 GLM5.3 Flash와 Qwen 3.8 Flash Next 모델이 로컬 환경에서 Deepseek V4 Flash 0731 모델과 비교하여 성능 차이를 보인다. 특히 DGX Spark 환경에서 GLM5.3 Flash의 NVFP4 퀀텀 버전에 대한 성능 우려가 있었으나, 실제 Humaneval 벤치마크 결과는 혼재된 양상을 나타낸다. Deepseek V4 Flash 0731은 fp8 KV, 1M 컨텍스트, 4 동시 스트림으로 구성되었고, GLM5.3 Flash는 NVFP4 퀀텀, fp8_e4m3 KV, 256k 컨텍스트, 6 동시 스트림으로 테스트됐다. 벤치마크 결과는 해당 하드웨어 구성에서 어떤 모델이 더 유리한지 판단하는 데 도움을 준다.