GitHub 트렌딩을 그대로 나열하지 않고, Claude Code · RAG · 로컬 AI · 에이전트 워크플로우 · 평가 도구 · AI 앱 빌더 관점에서 실제 빌더가 쓸 만한 오픈소스 스택을 다시 정리합니다.
PDF·DOCX·PPTX·이미지·오디오 등 모든 걸 LLM에 먹이기 좋은 깨끗한 마크다운으로 변환. RAG 전처리에서 압도적으로 편함.
Convert anything (PDF, Word, PPTX, images, audio) into clean Markdown for LLM ingestion.
2.78조 파라미터 Kimi K3 모델을 단일 CPU와 8.24GB RAM으로 추론한다. BLAS, 프레임워크, GPU 없이 C99로만 구현되어 압도적인 휴대성과 경량 추론 환경을 제공한다.
A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU.
Pandas보다 5~30배 빠른 dataframe. lazy evaluation + Arrow 기반으로 메모리 효율도 좋음.
Dataframes powered by a multithreaded, vectorized query engine, written in Rust.
Pandas + DuckDB 조합이 데이터 분석의 새 표준. SQL로 거대 파일 즉석 쿼리.
DuckDB — an in-process SQL OLAP database management system.
MS의 그래프 기반 RAG. 일반 RAG보다 multi-hop 추론이 강해서 복잡 도메인에 적합.
A modular graph-based Retrieval-Augmented Generation system.
Hugging Face의 모델 허브를 다루는 표준 라이브러리. 새 모델이 나오면 가장 먼저 여기에 들어와요.
State-of-the-art Machine Learning for Pytorch, TensorFlow, and JAX.
Mixpanel·Amplitude의 오픈소스 대체. 셀프호스팅 가능하고 LLM 관측까지 추가됐어요.
Open-source product analytics, session replay, feature flags, A/B testing.
ML 연구의 사실상 표준 프레임워크. dynamic graph·확장성·생태계 모두 1위.
Tensors and Dynamic neural networks in Python with strong GPU acceleration.
대규모 벡터 검색 전용 DB. 대용량(10억+ 벡터)에서 가장 검증된 OSS 선택.
Milvus — open-source vector database for AI applications.
내 DB 스키마를 학습시켜 자연어 → 정확한 SQL을 만드는 라이브러리. 분석가 워크플로우에 강해요.
Chat with your SQL database — accurate Text-to-SQL Generation via LLMs using RAG.
Python 한 파일로 인터랙티브 데이터 앱 만드는 도구. PoC 만들기 가장 빠름.
Streamlit — A faster way to build and share data apps.
Postgres에 벡터 검색 추가하는 extension. 별도 vector DB 없이 RAG 쉽게 시작.
Open-source vector similarity search for Postgres.
음성 인식의 표준. 99개 언어 지원하고 한국어 정확도가 매우 높아요.
Robust Speech Recognition via Large-Scale Weak Supervision.
OSS 모델 fine-tuning에서 가장 인기있는 도구. LoRA·QLoRA·Full FT 다 지원.
Go ahead and axolotl questions — fine-tuning toolkit.
Rust 기반의 lightweight 임베딩 DB. 멀티모달과 데이터 레이크 패턴에 강해요.
Developer-friendly, embedded retrieval engine for multimodal AI.
ML 학습·서빙·하이퍼파라미터 튜닝을 분산 처리하는 통합 프레임워크.
Unified framework for scaling AI and Python applications.
Airflow의 모던 대안. UX와 디버깅이 훨씬 좋고 데이터 사이언스 워크플로우에 친화적.
Modern workflow orchestration framework — easier than Airflow.
데이터 asset 중심 오케스트레이터. 데이터 lineage·observability에 강해요.
Dagster — a data orchestrator for the modern data stack.
Netflix·Uber·Spotify 등이 공개한 프로덕션 ML 사례 모음. 실무 패턴 학습에 최고.
📚 Papers & tech blogs by companies sharing their work on data science & machine learning in production.
분석가가 SQL로 데이터 변환을 작성하는 표준. modern data stack의 핵심.
dbt — Data Build Tool for analytics engineers.
Stable Diffusion LoRA 학습의 사실상 표준 도구. 캐릭터·스타일 학습이 직관적.
Training, generation and utility scripts for Stable Diffusion.
주간 업데이트되는 Python ML 라이브러리 랭킹. 새 도구 발견할 때 첫 출발점.
🏆 A ranked list of awesome machine learning Python libraries.
금융 도메인에 특화된 오픈소스 LLM 프로젝트. 뉴스 감성·시계열·로보어드바이저까지 노트북으로 다루고 있어요.
Open-Source Financial Large Language Models — democratizing internet-scale data for AI in finance.
빅데이터 처리의 클래식. 여전히 페타바이트급에서 강력한 옵션.
Apache Spark — A unified analytics engine for large-scale data processing.
전통적 ML 알고리즘의 표준 라이브러리. 분류·회귀·클러스터링 모두 한 곳에서.
Machine Learning in Python — classical ML algorithms.
GraphQL API 기반의 vector DB. 모듈식 ML 통합이 강점이고 RAG에 친화적.
Weaviate — open-source vector database that stores both objects and vectors.
알리바바의 HuggingFace 대안. 중국 모델·비디오 생성 모델이 풍부.
ModelScope — bring the notion of Model-as-a-Service to life.
LLM 벤치마크 표준. HellaSwag·MMLU 같은 평가를 한 번에 돌리는 프레임워크.
A framework for few-shot evaluation of language models.
과학 연구를 위한 오픈소스 AI 워크벤치이다. AI 에이전트와 CLI 도구를 활용해 연구 과정을 효율화한다.
The open-source AI workbench for scientific research
구글의 ML 프레임워크. 프로덕션 deployment·TFLite·TFJS 같은 endpoint가 강점.
An Open Source Machine Learning Framework for Everyone.
Pandas/NumPy를 분산 처리로 확장하는 도구. 사이즈가 메모리를 넘을 때 첫 옵션.
Parallel computing with task scheduling.
오픈 비전 LLM의 출발점. 이미지를 이해하는 LLM을 만들고 싶다면 첫 학습 자료.
Visual Instruction Tuning — LLaVA towards GPT-4V level.
Karpathy의 GPT 학습 코드. 단순함이 무기이고 LLM 내부를 직접 보고 싶을 때.
The simplest, fastest repository for training/finetuning medium-sized GPTs.
Speculative Decoding 알고리즘 훈련과 평가를 위한 풀스택 코드베이스를 제공한다. LLM 추론 속도 개선 연구에 필수적인 도구로 활용된다.
DeepSpec: a full-stack codebase for training and evaluating speculative decoding algorithms
MS 리서치가 만든 다중 모델 오케스트레이터. HuggingFace 모델을 LLM이 도구로 호출.
JARVIS — connecting LLMs with ML community models.
import 한 줄만 바꾸면 Pandas 코드가 멀티 코어로 돌아가는 마법.
Modin — Scale your pandas workflows by changing one line of code.
CLIP 같은 비전-언어 모델을 적은 데이터로 파인튜닝하는 기법 구현체.
Conditional Prompt Learning for Vision-Language Models.
Salesforce가 만든 비전-언어 모델 모음. BLIP·CLIP 등이 통합 인터페이스로 묶여있어요.
LAVIS — a Library for Language-Vision Intelligence.
MS의 통합 음성-텍스트 모델. ASR·TTS·음성 변환 한 모델로.
Unified-Modal Speech-Text Pre-Training for Spoken Language Processing.
100일 동안 ML 코딩을 실천하는 프로젝트입니다. ML 코딩, ML 구현, ML 그래프, ML 알고리즘을 포함합니다.
100 Days of ML Coding
2026년 여름 소프트웨어 엔지니어링, 데이터 과학, AI, 퀀트 등 다양한 분야의 인턴십 공고를 모아 제공한다. Simplify와 Pitt CSC에서 매일 업데이트하며, 인턴십 준비에 활용된다.
Summer 2027 software engineering, data science, AI, quant, product management, and hardware internship postings. Updated daily by Simplify and Pitt CSC.
분산된 학습과 추론을 위한 옵티마이저. GPU, TPU.
DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.
대화 기반 어시스턴트를 제공하는 오픈 소스 프로젝트.
OpenAssistant is a chat-based assistant that understands tasks, can interact with third-party systems, and retrieve information dynamically to do so.
실시간 미디어에 대한 ML 솔루션입니다.
Cross-platform, customizable ML solutions for live and streaming media.
GPT Image 2 / Gemini 2 Flash에 견줄 만한 오픈소스 편집 모델. API 비용이 부담스러우면 self-host 옵션.
A SOTA open-source image editing model, which aims to provide comparable performance against the closed-source models like GPT-4o and Gemini 2 Flash.
마이크로소프트가 제공하는 초급부터 전문가 수준까지의 Rust 트레이닝 자료 모음입니다.
Beginner, advanced, expert level Rust training material
실시간 다중 사람 키 포인트 감지 라이브러리. 몸, 얼굴, 손, 발측.
OpenPose: Real-time multi-person keypoint detection library for body, face, hands, and foot estimation
AI 엔지니어링의 기본부터 실제 서비스 구축까지 다루는 실습 중심의 학습 자료다. 에이전트와 컴퓨터 비전 등 다양한 AI 분야를 포함한다.
Learn it. Build it. Ship it for others.