AI 2건 · 일반 0건
Anthropic이 Claude Opus 5.5를 출시했으며, 곧이어 OpenAI는 GPT-6 Sol과 GPT-6 Luna를 공개했다. GPT-6 Sol과 Luna는 기존 GPT-5.6 모델 가격의 절반 수준으로 제공한다. 이는 LLM 시장에서 가격 경쟁을 한층 가속화하는 계기가 된다.
AssBench는 LLM의 코드 생성 능력, 특히 안전성에 중점을 둔 새로운 벤치마크다. 기존 벤치마크는 LLM의 코드 생성 성능 측정에 국한되었지만, AssBench는 생성된 코드의 잠재적 위험성을 평가하는 데 초점을 맞춘다. 이를 통해 더 안전하고 신뢰할 수 있는 LLM 개발을 촉진할 것으로 기대된다.