AI 4건 · 일반 0건
OpenAI Python SDK v3.19.2가 릴리즈되었다. 이번 버전은 특정 파일 추출 경로 버그를 수정한다. 또한, 웹 검색 위치 기본값, Realtime 모달리티 배열 정의, fine-tuning 경계 참조 등 API 명세가 명확해졌다. 개발자는 이 개선으로 OpenAI API를 더 정확하게 이해하고 안정적으로 활용한다.
Google은 Gemini 3.8 Flash와 Flash-Lite TTS를 공개했다. 이 새로운 Text-to-Speech 모델은 SOTA 성능을 제공하며, 새로운 음성 디자인 경험을 지원한다. 2,000개 이상의 상용 음성과 100개 언어를 지원하며, Hume AI의 음성 벤치마크에서 1위를 차지한다.
Simon Willison은 자신의 블로그 데이터셋 백업본과 ChatGPT iPhone 앱을 이용해 음성 대화를 시도했다. datasette-mcp를 통해 블로그 데이터에 접근하고 음성으로 질의하며 답변을 받는 경험은 LLM의 새로운 활용 가능성을 보여준다. 이는 개인 데이터와 LLM을 결합하여 정보를 소비하는 방식을 혁신할 잠재력을 지닌다.
Google이 새로운 Gemini 3.8 Text-to-Speech 모델 두 가지를 출시했다. 이 모델들은 2,000개 이상의 음성을 지원하며, 30초 오디오 샘플만으로 사용자 정의 음성 생성이 가능한다. Simon Willison이 개발한 Gemini 3.8 TTS Playground는 Gemini API의 개방형 CORS 정책을 활용하여 이 기능을 쉽게 테스트할 수 있도록 제공한다. 개발자는 이 플레이그라운드를 통해 자신만의 키를 사용하여 다양한 TTS 기능을 실험한다.