K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

hardrave/NIGHTRUN

202Rust

插上U盘直接开机就能聊天的离线AI电脑,不需要操作系统

NIGHTRUN是用Rust写的程序,直接在电脑固件层面运行,开机后不经过任何操作系统就能进入离线AI聊天界面。它把压缩过的AI模型整体读入内存,边读边校验有没有损坏,读完之后就彻底封死磁盘,后续再也不能读写存储设备。为了确保回答准确,它把生成结果和知名的LLM推理引擎llama.cpp逐个词元对比,保证完全一致。

它做什么

  1. 整个系统是一个运行在UEFI(开机固件)之上的单一程序,自己画屏幕、读取USB键盘输入、调用多个CPU核心跑AI计算,底下没有Linux、没有内核、也没有网络协议栈。
  2. 支持Llama 3.2、Qwen3、Granite 4.1三个模型系列,体积在1.3到2.4GB之间,通过Q8_0、Q4_K、Q6_K这类压缩方式(量化)缩小模型体积,再用针对具体CPU类型手写的高速运算代码(AVX2、NEON)来加速。
  3. 为保证正确性,项目把自己的输出和广泛使用的LLM推理引擎llama.cpp逐个词元比对,连负责切分文本的分词器也拿官方Hugging Face实现做测试。
  4. 安装程序很谨慎:自动排除电脑的系统盘,写入U盘或SD卡前必须手动输入完整设备路径确认,写完后还会重新读取一遍,核对内容和原文件是否完全一致。
  5. 在8核虚拟机(QEMU/KVM)环境下,Llama 3.2 1B模型处理提示词的速度约为每秒52到56个词元,生成回答约每秒20个词元,从开机到进入聊天界面只需5.6秒;而在真实的树莓派5上跑更大的3B模型速度慢得多,目前只有每秒3.0个词元。

为什么重要

它展示了AI模型脱离操作系统、直接跑在硬件上的真实可行方案,对关注离线、难以被篡改的极简AI设备的人来说很有参考价值。同时它也是一次实验,验证AI编程助手能否胜任像启动程序、二进制模型格式、底层运算这类系统级软件开发,而不只是常见的网页应用。

本仓库术语

  • UEFI · 操作系统加载之前先启动电脑的固件
  • no_std · 不依赖完整操作系统标准库编写的Rust代码
  • GGUF · 一种常见的存储压缩AI模型权重的文件格式
  • 量化(Q8_0、Q4_K、Q6_K) · 把模型数值压缩成更少比特以节省内存和提速,同时牺牲一点精度
  • KV缓存 · 保存模型之前计算结果的内存区域,避免每生成一个新词都要重新计算

仓库简介(英文)

Boot your PC straight into an LLM. Rust, UEFI-resident, no operating system underneath.

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道