lamhotsiagian/llm-system-design
一个可以逐个模块拆解、亲手运行的生产级LLM系统设计代码库
这个仓库分两部分:project 用纯 Python 实现了真实 LLM 服务栈所需的路由、检索增强生成(RAG)、安全护栏和智能体控制逻辑,不依赖任何重型框架;lab 则是基于 LangChain 和 Streamlit 搭建的可视化网页实验室。project 包含约30个模块和150多个离线测试,lab 可以连接本地 Ollama 模型(llama3.1、nomic-embed-text),也能在没有服务器时自动切换到确定性离线模式运行。也就是说,不需要真实服务器或 API 密钥,任何人都能运行并观察一个 LLM 系统内部各组件的实际执行过程。
它做什么
- project 文件夹用纯 Python 标准库实现了约30个模块,涵盖容量与成本计算、请求处理流水线、路由、缓存、安全过滤、训练基础设施公式、推理引擎、RAG、工具调用、智能体、多智能体编排、监控、自动扩缩容和可靠性工程
- lab 文件夹用 LangChain 和 Streamlit 搭建了网页界面,可以点击体验路由、RAG、智能体、护栏、语义缓存、推荐系统和评估等功能,并实时查看执行轨迹
- lab 默认使用 auto 后端:如果本地 Ollama 服务在运行,就使用真实的 llama3.1 和 nomic-embed-text 模型,否则自动切换为无需服务器的确定性离线模式
- project 自带150多个基于 pytest 的离线测试,lab 也可以通过设置 LAB_BACKEND=offline 环境变量在完全离线状态下运行测试,保证结果可复现
- 还可以选择启动基于 FastAPI 的 HTTP 服务器,或连接 vLLM、TGI、Ollama 等兼容 OpenAI 接口的外部服务
为什么重要
它把路由、RAG、安全护栏、智能体、缓存、可观测性这些抽象的 LLM 系统设计概念,变成了可以运行和查看的实际代码,适合用作系统设计学习、面试准备或内部原型开发的实践教材。
本仓库术语
- RAG(检索增强生成) · 先检索相关文档、再依据文档内容生成回答的方式
- ReAct 智能体循环 · 模型交替进行推理、调用工具、观察结果以解决任务的模式
- KV缓存 · 保存此前计算过的注意力结果,以加快生成下一个词元的速度
- LCEL · LangChain 中把多个处理步骤像管道一样连接起来的链式写法
- 护栏(guardrails) · 用于过滤危险输入或不安全输出的安全检查机制
仓库简介(英文)
A production-grade LLM System Design platform & interactive lab. Features a pure-Python LLM serving, RAG, routing, safety, and agent control plane (150+ offline tests) plus a LangChain + Streamlit UI with local Ollama models.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库