/ Daily Archive · LATTICE NOTES · 오늘의 큐레이션 노트
오늘 Anthropic이 직접 공개한 에이전트 사용 분석 보고서가 눈에 띄었습니다. 수백만 건의 실제 툴 호출을 분석한 결과, 에이전트 활용이 소프트웨어 개발 영역에 집중돼 있고 비코딩 환경에서는 실패율이 매우 높다는 점을 수치로 확인해줬습니다.
같은 날 ITBench-AA 벤치마크에서 가장 좋은 모델도 기업 IT 작업의 절반을 못 맞혔다는 결과가 나왔고, Claude Code 설치 UX가 멀웨어처럼 보인다는 커뮤니티 지적과 SQLite의 에이전트 정책 문서화 같은 소식도 이어졌습니다. 오늘은 에이전트가 어디서 잘 작동하고 어디서 막히는지를 여러 각도에서 확인하는 하루였습니다.
에이전트가 잘 작동하는 곳과 잘 안 되는 곳이 이제 데이터로 분리되고 있습니다. 어디에 쓸지보다 어디에 쓰지 말아야 할지를 아는 것이 지금 더 중요한 판단입니다.
오늘 볼 포인트는 에이전트 한계 데이터와 국내 빌더 실전 사례, 이 두 시그널과 내 업무에 맞는 기준을 함께 보는 것입니다.
Model Context Protocol의 2026-07-28 RC 버전이 출시됐다. 이 버전은 최종 출시 이전의 후보 버전으로, 사용자와 개발자들은 이 버전에 대한 피드백을 제공할 수 있습니다. MCP는 모델과 컨텍스트를 연결하는 프로토콜로, 다양한 애플리케이션에서 사용될 수 있습니다. 이 버전의 변경 사항은 공식 문서에서 확인할 수 있습니다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.최근 연구에서는 14개의 오픈 소스 안전 가드 모델을 평가했다. 이 연구에서 Qwen Guard가의 리콜을 달성했으며, 이는 안전 관련 애플리케이션에서 리콜이 중요한 지표임을 보여줍니다. 이러한 연구는 사이버 공격 및 부적절한 콘텐츠를 방지하기 위한 모델의 개발에 기여한다. 큰 모델은 리콜이 낮을 수 있습니다. 리콜은 안전 관련 애플리케이션에서 중요한 지표이다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.GaryMarcus는 LLM의 미래에 대해 의견을 제시합니다. OpenAI와 Anthropic은 어려움을 겪을 것으로 예상됩니다. LLM은 상당히 저렴해질 것이며, 대부분의 회사는 투자금을 회수하기 어렵게 될 것이다. Nvidia의 성장도 정체할 것으로 보인다. 이러한 변화는 LLM의 발전에 큰 영향을 미칠 것이다. LLM의 발전은 기술의 발전과 함께 더 빠르게 진행될 것이다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.OpenAI는 심각한 어려움에 직면해 있으며 이는 WeWork의 전철을 밟을 가능성이 있습니다. Anthropic도 안전한 상황이 아니다. Anthropic의 가장 좋은 분기는 토큰 맥스화가 최고조에 달했을 때였으며, 이때는 일회성 보조금을 받았기 때문이다. 이 상황은 AI 개발과 관련된 회사들의 불안정성을 보여줍니다. 이러한 어려움은 기술 발전에 영향을 줄 수 있습니다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.다중모달 LLM 에이전트의 페르소나 효과를 분석하는 연구가 발표됐습니다. 이 연구에서는 페르소나 프롬프팅이 언어 생성에 미치는 영향을 조사하였으며, 결과는 페르소나에 따른 설명의 차이를 보여줍니다. 이는 LLM 에이전트의 페르소나 설정이 중요함을 시사한다. 다중모달 LLM 에이전트는 다양한 상황에서 활용될 수 있으며, 페르소나 효과를 이해하는 것은 이러한 에이전트의 개발과 활용에 중요한다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.구글은 최근 I/O 2026에서 가장 앞선 기술을 공개했다. 구글 리서치는 특히 인공지능 기반 도구를 개발하여 과학적 발견을 가속화하고 있습니다. 이 기술은 연구자들이 다양한 분야에서 새로운 발견을 할 수 있도록 도와준다. 또한, 구글은 에이전트 기반 코딩 플랫폼을 개발하여 개발자들이 더 효율적으로 코드를 작성할 수 있도록 지원합니다. 이러한 기술은 구글의 제품을 더 유용하게 만들고 연구자들이 과학적 및 사회적 문제를 해결하는 데 도움을 준다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.GPT-5 Pro 시리즈 모델이 지난 여름부터 가장 어려운 문제를 단일 시도에서 가장 잘 해결해왔다. 이는 다른 모델이 이러한 문제를 해결하는 데 도움이 될 수 있습니다. GPT-5 Pro 모델의 성능은 최근 몇 개월 동안 다른 모델에 비해 월등히 높았다. 이는 GPT-5 Pro 모델이 어려운 문제를 해결하는 데 유용할 수 있습니다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.γ-World는 2인 이상의 플레이어가 참여할 수 있는 SoTA(최적) 멀티 에이전트 월드 모델이다. 이 모델은 24 FPS의 실시간 성능을 제공하며, 다양한 에이전트와 상호작용할 수 있습니다. γ-World는 기존의 2인용 게임을 넘어서서 다중 에이전트가 참여하는 게임을 구현할 수 있습니다. 이 기술은 게임 개발과 인공지능 연구에 새로운 가능성을 열어준다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.Gemma4 26B A4B 모델은 개인 컴퓨터에서도 놀라운 속도를 보여줍니다. 코딩, 창작, 대화 등 다방면에 걸쳐 준수한 성능을 내며, 웹 검색 도구를 연동하면 더욱 강력해진다. Qwen3.6 35B A3B와 비교했을 때, Gemma4는 코딩 외 작업에서 더 나은 대화 경험을 제공한다. 로컬 LLM 환경에서 범용성과 효율성을 모두 잡았다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.vllm-project의 최신 버전 v0.22.0이 출시됐다. 이 버전에서는 DeepSeek V4 모델의 안정성이 향상되었으며, Model Runner V2가 기본으로 설정됩니다. 또한, Rust 프론트엔드 통합과 배치 불변성 개선이 이루어졌습니다. 이러한 업데이트는 개발자들이 더 안정적이고 효율적인 코드를 작성할 수 있도록 도와준다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.Claude의 새로운 버전인 Opus 4.8이 출시됐다. 이 버전은 이전 버전보다 더 나은 성능과 기능을 제공한다. Opus 4.8은 더 나은 대화 능력과 더 정확한 정보 제공을 목표로 개발됐다. 개발자들은 이 새로운 버전을 활용하여 더 나은 서비스를 제공할 수 있습니다. Opus 4.8의 출시로 개발자들은 더 나은 성능과 기능을 제공할 수 있습니다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.익명의 개발자가 오픈 소스 Java 테스트 엔진 jqwik에 AI 코딩 에이전트를 겨냥한 악의적 지시를 숨겨 파문이 일었다. 해당 지시는 AI 에이전트가 jqwik 테스트 및 코드를 삭제하도록 유도하여, AI의 프롬프트 해석 취약점을 이용한 일종의 프롬프트 주입 공격이다. 이 사건은 AI 개발 도구의 윤리적 사용과 보안에 대한 심각한 우려를 제기한다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.2015년 글에서 개발자가 복잡한 디자인 툴 없이 코드만으로 간단한 아이콘이나 그래픽을 직접 생성하는 방법을 탐색한다. 1x, 2x, 3x 스케일 이미지 대응의 번거로움과 반복적인 작업 과정을 줄이는 데 초점을 맞춘다. 코드로 이미지를 그리는 것은 단순 그래픽에 한해 합리적인 접근이 될 수 있음을 시사한다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.Trajectory 팀이 Continual Learning 문제 해결에 기여한다. 이 팀은 지속적인 학습 능력을 향상시키기 위한 혁신적인 접근법을 제시합니다. LLM이 실제 환경에서 발생하는 변화에 적응하고 발전하는 데 중요한 역할을 한다.
$ 원문 링크를 5분만 훑고, 내 작업에 닿을 지점을 한 줄로 메모해보세요.2010년 영화 'Tron: Legacy'의 쉘 히스토리 장면을 세밀하게 분석한 글이 lobste.rs에서 개발자 커뮤니티의 관심을 끌었습니다. 단순한 오류 찾기를 넘어 시스템 추론과 등장인물 행적까지 추론하는 방식이 흥미를 자아냈습니다. LLM을 이용한 코드 분석 능력과 레트로 감성이 결합된 드문 콘텐츠입니다.
$ lobste.rs에서 해당 스레드를 열고 댓글의 시스템 분석 토론을 읽어보세요.
GPT-Realtime-2와 Onhand의 통합으로 AI 튜터 에이전트가 등장하며 교육 분야에서 빌더들의 관심을 모으고 있습니다. 실시간 음성 모델을 교육 시나리오에 적용하는 방식이 구체적인 사용 사례로 공유됐습니다. 아직 초기 단계지만 실시간 AI와 도메인 에이전트의 결합 가능성을 보여주는 시그널입니다.
$ @jxnlco의 X 게시글을 열고 GPT-Realtime-2 + Onhand 통합 방식을 확인해보세요.
비미분 가능 목표에 확산 모델을 정렬하는 새로운 강화학습 프레임워크가 arXiv에 공개됐습니다. UNet과 DiT 기반 모두에서 기존 방법을 능가한다는 결과가 나왔지만, 실제 이미지 생성 파이프라인 적용까지는 추가 검증이 필요하다는 시각이 우세합니다. 이론적으로 흥미롭지만 빌더 도입까지는 거리가 있는 초기 연구입니다.
$ arXiv에서 논문 초록과 벤치마크 결과를 읽고 현재 쓰는 이미지 모델에 적용 가능성이 있는지 판단해보세요.
Mistral AI 파이썬 클라이언트 2.4.7 버전이 출시됐습니다. OpenAPI 문서 기반의 꾸준한 릴리스 사이클이 유지되고 있으며, 개발자 커뮤니티는 안정성 개선 패턴을 모니터링하고 있습니다. 주요 기능 변경보다는 유지보수 중심의 업데이트로 볼 수 있습니다.
$ PyPI에서 Mistral AI 클라이언트 changelog를 확인하고 현재 버전의 호환성 변경 사항이 있는지 체크해보세요.