AI平台

SlotStream

SlotStream官网,开源本地LLM推理引擎,SSD专家流式加载让低内存Mac运行125B MoE大模型。

标签: 大模型API全网最稳定的官方企业级渠道
一站式AI创作平台

SlotStream官网

SlotStream 是一个开源的本地大模型推理引擎(GitHub: carloslfu/slotstream),用 Swift + MLX 编写,专攻一个此前被视为”不可能”的场景:让内存远小于模型体积的 Mac 也能本地运行超大 MoE 模型。它通过”专家槽位流式加载”(SSD expert slot streaming)技术,把 Qwen3.8-Flash-Next(125B MoE,4-bit 下约 104 GB)的专家权重从 SSD 直接流式读入 Metal 环形缓冲区执行矩阵运算,最低 8 GB 内存(推荐 16 GB)即可运行——传统方案需要把全部权重装进内存,而 SlotStream 只在需要时加载当前激活的专家。单文件 Swift 二进制、零 Python 依赖、无需 Xcode,内置 `slotstream serve` 提供 Ollama 兼容 API(11434 端口),Open WebUI、Ollama CLI 与 OpenAI SDK 可直接接入。在 48 GB Mac 上热生成速度约 12 tok/s,配合投机解码(MTP 草稿头,首遍接受率 86%)与跨会话 KV Cache 复用(32K token 内后续回合首 token 延迟持平在约 6 秒),对想在 Mac 上白嫖顶级开源模型、又不想升级内存的开发者来说是一个工程上非常硬核的解法。

SlotStream的主要功能:

  1. SSD 专家流式加载:核心创新,将 125B MoE 的专家权重按需从 SSD 流式载入 Metal 环形缓冲区,内存占用最低 8 GB 即可运行 104 GB 模型,突破”模型必须装进内存”的限制;
  2. Ollama 兼容 API:`slotstream serve` 在 11434 端口实现 chat/generate 子集,支持流式输出、CORS 与常规采样参数,Open WebUI、Ollama CLI、OpenAI SDK 均实测可直连;
  3. 投机多 Token 预测(MTP):内存充裕(目标分配超 26 GB)时启用辅助草稿头并行预测后续 token,首遍草稿接受率 86%,把 48 GB Mac 的热生成速度提升到约 12 tok/s;
  4. 跨会话 KV Cache 复用:多轮对话中复用最多 32,768 token 的前缀 KV 缓存,后续回合只需 prefill 新增内容,8 轮对话后首 token 延迟从 25.8 秒降到 6.0 秒;
  5. 硬件体检工具:`slotstream doctor` 在下载前诊断内存、磁盘余量并预测解码性能,还支持 `–sim-ram 16` 模拟低配机器的表现;
  6. 完整性保障:104 GB 权重按 SHA-256 哈希(编译进二进制)校验,GitHub Release 附带签名证明(gh attestation verify),断点续传安全,中断后最多重传在途分块;
  7. 零依赖单二进制:整包 Swift 二进制免装 Python/Conda/PyTorch,macOS 自带 Command Line Tools 即可编译,安装脚本一条命令完成。

如何使用SlotStream?

使用流程如下:

  1. 打开终端执行安装脚本:`curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh`,二进制安装到 `~/.slotstream/bin`;
  2. 运行 `slotstream doctor` 体检:查看机器的内存规划、磁盘能否容纳 104 GB 权重与预估速度(低配机器可加 `–sim-ram 16` 模拟);
  3. 确认无误后执行 `slotstream pull` 下载 103.8 GB 权重(24 个文件,一次性下载,支持断点续传;100 Mbps 带宽约需 2 小时 20 分);
  4. 先来个单发测试:`slotstream run –prompt “why is the sky blue?”`;
  5. 启动常驻服务:`slotstream serve`,然后用 Ollama CLI、Open WebUI 或 OpenAI SDK 按 `qwen3.8-flash-next:4bit` 模型名正常调用即可。

SlotStream的使用场景:

  1. 低内存 Mac 跑大模型:16 GB MacBook Air 用户也能本地运行 125B MoE 模型,离线问答、写作、代码辅助不再依赖云 API,也不必为跑模型升级内存或购新机;
  2. 接入现有本地 LLM 生态:通过 Ollama 兼容端口直接挂进 Open WebUI、桌面客户端或自建 Agent 脚本,把云端大模型能力平移到本地工作流;
  3. 隐私敏感场景离线推理:合同审阅、内部文档问答等不便上传云端的数据,可在本地完成全部推理,数据不出机;
  4. 性能与架构研究:SSD 流式专家加载、投机解码、前缀 KV 复用三项技术的开源实现,为端侧推理引擎的工程研究提供了可复现的参考代码。

SlotStream:产品价格与版本

  1. 完全免费开源:项目在 GitHub 开源(carloslfu/slotstream),引擎与权重下载均免费,无任何付费门槛,用户只需自备磁盘空间(约 110 GB)与满足条件的 Mac;
  2. 硬件门槛:官方给出的最低内存为 8 GB(推荐 16 GB),实测速度以 48 GB Mac 为准(约 12 tok/s),更小内存机器速度按官方曲线递减;模型上下文上限 32,768 token(–max-context)。

SlotStream的常见问题解答:

长时间流式读 SSD 会伤硬盘吗?
这是项目的主要争议点:长推理会话会持续以 GB/分钟级的速率读取系统盘,在无风扇的轻薄 MacBook 上可能触发热节流并加速 NVMe 寿命损耗。建议台式 Mac 或散热好的机型长时间使用,轻薄本控制单次会话时长。
为什么首条消息(prefill)特别慢?
SlotStream 需要顺序处理全部专家层才能输出第一个 token,8,000 token 的提示词在 48 GB Mac 上约需 60 秒,16 GB 机器超过 3 分钟;但开启前缀缓存后,同一会话的后续回合只需处理新增内容,延迟会稳定在约 6 秒。
支持工具调用、图像输入和 JSON 输出吗?
暂不支持。视觉输入、function calling/tools、JSON Schema 输出与 logprobs 目前会被明确拒绝(返回 HTTP 400 而非静默忽略),适合纯文本对话与生成场景;细节见仓库 docs/API.md。

相关工具推荐

本地与云端大模型生态可以搭配着用:Ollama 是最主流的本地模型运行时,SlotStream 的 API 直接兼容它的客户端生态;Qwen 是本引擎默认装载的开源模型家族的官方入口;如果机器跑不动本地大模型,也可以转向 OpenRouterAI大模型聚合平台 这类云端聚合服务按量调用。

SlotStream官网网址:

SlotStream官网入口网址:https://github.com/carloslfu/slotstream

OpenI AI时代点评

当大家都在卷云 API 的价格战时,SlotStream 选了一条”识”的硬核路线:既然 104 GB 装不进内存,那就别装——按需从 SSD 流式加载激活的专家。MoE 架构每次只激活一小部分专家的特性,让它”骗过”了内存墙,8 GB 内存跑 125B 模型这个数字本身就是最好的传播点;单二进制、零 Python 依赖、Ollama 兼容、SHA-256 全程校验,工程质量相当扎实。代价也同样清晰:prefill 延迟分钟级起步、SSD 长期高负载读写、功能砍到纯文本对话,注定它只适合”要本地、要离线、能等”的特定人群。它更像一个方向验证器——证明了 SSD 带宽可以当内存用——如果后续有团队在这个思路上解决 prefill 和硬盘损耗问题,端侧跑前沿大模型的门槛还会再降一个量级。Mac 用户手里有闲置磁盘空间的,值得折腾一次。

数据评估

SlotStream浏览人数已经达到1,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:SlotStream的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找SlotStream的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于SlotStream特别声明

本站OpenI提供的SlotStream都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 9月 2日 上午11:09收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

相关导航