juxhinr/bindwidth
一个帮你算清楚自建大模型到底需要几台服务器、是否真比租用便宜的计算器
Bindwidth是一个开源、纯浏览器运行的计算器,用于评估企业本地部署大语言模型所需的硬件规模和总拥有成本。它会分别计算三种技术限制——显存中的KV缓存容量、prefill与decode合并后的处理能力、以及并发会话上限——找出真正卡住系统的那一个瓶颈,再据此估算硬件成本。整个工具在浏览器本地运行,不经过服务器、不使用数据库、不收集任何数据,并能透明对比自购硬件、主权云租赁和厂商订阅三种方案。
它做什么
- 把人类交互用户和24小时运行的自主智能体当作结构不同的负载分别建模计算峰值
- 用六个模型架构参数(总参数量、激活参数量、每参数字节数、每token的KV缓存大小、每步接受的token数、prefill/decode比例)来决定所需GPU数量和生成速度
- 分别计算显存、处理吞吐量、会话并发三个独立限制,取其中要求最高者作为真正的瓶颈
- 为每条硬件和模型数据标注置信度等级(实测、公开发表、社区反馈、估算等),让用户清楚哪些是验证过的、哪些是推测的
- 整个计算逻辑用无依赖的纯JavaScript函数写成,并配有固定测试用例保证计算结果可复现
为什么重要
它把常见的'要不要自建AI'讨论,从单纯的预算问题重新定义为规模测算问题——按错误的限制条件采购硬件会导致产能浪费,同时错过真正会在高负载下失效的那个限制。对于在数据主权和成本控制之间权衡本地AI基础设施与云端订阅的团队来说,这一点很关键。
本仓库术语
- KV缓存 · 模型生成文本时用来记住之前对话内容的临时内存数据
- prefill/decode · 服务的两个阶段:处理输入提示词(prefill)和逐个生成输出token(decode)
- TCO(总拥有成本) · 运行硬件的全部成本,包括购置费、电费和人力管理成本,而不只是采购价
- MoE(专家混合模型) · 一种模型架构,每次只激活部分参数,因此模型大小与生成速度可以分开决定
- 本地部署 · 在企业自有服务器上运行软件,而非使用云服务
仓库简介(英文)
Evidence-aware on-prem LLM inference sizing and TCO calculator
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库