GitHub 트렌딩을 그대로 나열하지 않고, Claude Code · RAG · 로컬 AI · 에이전트 워크플로우 · 평가 도구 · AI 앱 빌더 관점에서 실제 빌더가 쓸 만한 오픈소스 스택을 다시 정리합니다.
오픈 비전 LLM의 출발점. 이미지를 이해하는 LLM을 만들고 싶다면 첫 학습 자료.
Visual Instruction Tuning — LLaVA towards GPT-4V level.
CLI 한 줄로 이미지 배경 제거. rembg와 함께 양대 표준.
Background Remover lets you Remove Background from images.
Claude/ChatGPT 등 MCP 호환 클라이언트에서 자연어로 GPT Image 2를 호출. 1,400+ 프롬프트 라이브러리 내장.
Supports GPT Image 2, Nanobanana & ComfyUI, with a 1,400+ prompt library, carefully crafted hooks and a multi-task orchestration system.
OpenAI gpt-image-2 API 기반의 이미지 생성 및 편집 도구이다. React와 TailwindCSS로 구축되어 사용자 친화적인 인터페이스로 AI 이미지 작업을 효율화한다.
基于 OpenAI gpt-image-2 API 的图片生成与编辑工具
PyTorch 기반의 이미지-이미지 변환 모델인 CycleGAN과 pix2pix 구현체. 컴퓨터 비전 분야에서 이미지 스타일 변환 및 생성에 널리 사용된다.
Image-to-Image Translation in PyTorch
Stable Diffusion WebUI의 사실상 표준. extension 생태계가 가장 풍부.
Stable Diffusion web UI
ComfyUI, API 호출, Modelscope 호출을 지원하는 무한 캔버스 도구이다. 시각적 워크플로우 구성 및 다양한 AI 모델 연동에 활용된다.
Supports comfyui/API calls/modelscope calls
Claude Code Skill 패키지로 바로 설치할 수 있어서, 에이전트가 한 번에 GPT Image 2 호출하고 결과를 파일로 떨궈줍니다.
GPT Image 2 prompt gallery, image prompt library, agentic skill, and CLI for OpenAI image generation/editing.
AI 에이전트를 이용해 바이럴 영상을 복제하고 변형하는 종합 워크플로우를 제공한다. 얼굴, 대사, B-roll까지 교체하여 여러 버전을 자동으로 생성, 배포할 때 유용하다.
Clone any viral video with AI agents. Not just a script, the whole workflow: swap the face, the words, the B-roll, ship 100 variants in one command, and get your 100M views.
OpenAI 이미지 생성 및 편집 API를 CLI로 조작한다. 프롬프트 갤러리, 라이브러리, 에이전트 스킬을 제공하여 AI 이미지 작업을 쉽게 자동화할 수 있다.
GPT Image 2 prompt gallery, image prompt library, agentic skill, and CLI for OpenAI image generation/editing
쇼트폼·라이브 액션까지 할리우드 워크플로로 제어 가능한 AI 에이전트 기반 영상 제작 플랫폼입니다.
首家工业级全流程 AI 影视生产平台。Industry-first professional AI Agent platform for controllable film & video production. From shorts to live-action with Hollywood-standard workflows.
Claude Code 또는 Codex를 위한 소셜 카드 이미지 생성 스킬이다. 샤오홍슈 캐러셀과 위챗 커버 이미지를 다양한 레이아웃과 테마로 단일 HTML 파일에서 PNG로 자동 생성한다.
🪧 Claude Code / Codex skill — generate Xiaohongshu carousels & WeChat 21:9+1:1 cover pairs. Editorial × Swiss visual systems, 28 layouts, 10 themes, single-file HTML → PNG. 小红书图文 + 公众号封面对
13B 비디오 모델을 6GB GPU에서도 돌리는 viral 프로젝트. lllyasviel이 또 만들어 화제.
Make video diffusion practical — frame packing for 13B models on consumer GPUs.
확산 모델을 제어할 수 있는 라이브러리.
Let us control diffusion models!
프롬프트마다 프리뷰 이미지가 붙어있는 데일리 업데이트 라이브러리. Lattice의 GPT Image 2 큐레이션 51개도 여기서 출발했어요.
🚀 World's largest GPT Image 2 prompt library, updated daily — 2000+ curated prompts with preview images, 16 languages. OpenAI's next-gen image model with pixel-perfect text rendering, cross-image consistency, and commercial-grade illustration. Free & open source.