AI 2건 · 일반 0건
Gary Marcus는 현재 AI 시스템을 종이 안정판을 가진 비행기에 비유하며 그 취약성을 지적한다. 이러한 시스템은 통제하기 어렵고 쉽게 추락할 수 있다는 것이다. 이는 LLM 성능 측정의 한계를 드러내며, 실제 환경에서의 불안정성을 간과해서는 안 된다는 메시지를 전달한다. 벤치마크 결과가 실제 시스템의 안정성과는 거리가 멀 수 있음을 시사한다.
Reflection 70B는 2024년 9월 공개 당시 GPT-4o를 능가한다고 주장했으나, 실제 테스트 결과는 기대에 미치지 못했다. 이 사건은 LLM 모델의 과장된 발표와 실제 성능 간의 괴리를 보여주는 사례로 남는다. 오픈소스 LLM 생태계는 발표만으로 판단하기보다 실제 검증이 중요함을 시사한다.