交流 AI 工具、本地模型与 Agent,分享部署经验。
微信扫码加入;手机点击放大,保存后用微信识别。
本张二维码有效期:10 月 14 日前。
Strata 可以让电脑在本地运行大模型Qwen3.8-Flash-Next,模型能力和排行可以来👉这里查看,本地部署能提供基本的网页聊天,查询资料,识别图片,也能接入本地电脑agent智能体编程助手等,帮你干活整理资料等。先看 QA,再按步骤操作。
Niko1221/Strata · 向作者致敬
普通游戏电脑运行千亿参数本地大模型
国内用户观看 YouTube 可能需要科学上网。 若预览黑屏或加载失败,可直接 观看抖音版视频。
交流 AI 工具、本地模型与 Agent,分享部署经验。
微信扫码加入;手机点击放大,保存后用微信识别。
本张二维码有效期:10 月 14 日前。
资料说明
本文于 2026 年 10 月 10 日核对官方文档与最新正式版 v0.1.41(10 月 8 日发布)。硬件要求引用官方项目;QA 结合抖音视频中已读取的评论,未覆盖全部评论。视频里的界面和速度可能与新版不同。
已部署用户:这次更新值得关注什么?
parallel: 2 的死锁及部分引擎卡死。收益随配置变化,不能理解成所有电脑的输出速度都会翻倍。STRATA_PREFILL_CPU_SHARE=0,详见发布说明。先按 Q33:怎么更新 更新,再用相同短问题和常用任务比较。新手继续使用默认设置即可。
点击问题标题展开答案,再次点击收起。
先认清几个词
显存是显卡自己的内存;系统内存是内存条容量;上下文是一次能处理的文字量;Agent是能调用工具、读文件或执行任务的 AI 助手。
我视频中是 5070 Ti+64GB DDR4,IQ3_S。录屏约 50 多 token/s、日常约 90,属于个人体验,不代表同型号电脑都能达到。
32GB 优先选偏代码的 Coder;48GB 可选 IQ2_XS/Q2_0;64GB 可以尝试 IQ3_XXS/IQ3_S。想聊天和处理中文,内存充足时优先通用版本。
有用,可以选择更多模型,减少内存不足带来的卡顿。但容量翻倍不代表速度翻倍,CPU 和内存带宽也有影响。
显存不能直接替代系统内存。16GB 系统内存低于常规建议,可能需要频繁读硬盘;先换更省内存的版本,并查看内存占用。
官方说 NVIDIA 8GB 卡能运行,但较慢。按内存选版本、少发长文,并关闭看图功能。
官方未列出明确验证,不建议小白按这张卡准备部署。旧卡是否能用,需另外确认。
先确认实际显存,笔记本 3060 不能套用桌面版规格。32GB 优先试 Coder,显存不足时体验可能受限。
满足配置要求就能尝试,散热和功耗会影响速度。也可以让台式机运行模型,笔记本只负责访问。
当前常规安装面向 Windows/Linux,不能直接套用到苹果芯片。Mac 可以访问另一台已经部署好的电脑。
可以,官方支持 Windows 10/11,还要满足显卡、驱动和内存要求。
模型经过压缩,并让显卡、CPU、内存和 SSD 一起工作,不是把全部参数装进显卡。Coder 还减少了部分专家,通用能力会弱一些。
会读取 SSD,但读取不等于大量擦写。下载和系统换页会产生写入;内存不足时尤其要关注实际写入量、温度和卡顿。
有低内存模式,但通常更慢。硬盘不能等效替代内存,长期使用最好选适合现有容量的模型。
官方的 5070 12GB+Ryzen 5 7600+64GB 内存,短聊天测试中 IQ2_XS 约 79、IQ3_S 约 53 token/s(引擎 0.1.26);Q2_0 约 94 token/s(引擎 0.1.36)。这些是官方历史基准,不是 v0.1.41 的统一实测速度。token 是模型处理文字的单位,不等于汉字数;长文、思考模式和后台程序都会影响速度。
先用短问题测试,再只发送相关代码、减少历史,把 Thinking(思考)调到 low。网页 Monitor(监控)可查看是在读文字、思考还是输出。
先换更省内存的版本、关闭后台软件、减少上下文和同时进行的任务。虚拟内存可能避免部分报错,但频繁换页仍会很慢。
更强显卡也会受 CPU、内存和模型限制。项目没有一键叠加 ninfer 的官方流程,先按现有设置排查。
可以接入支持兼容接口的助手,由助手提供读文件、搜索和执行命令等工具;Strata 主要负责模型推理。网页聊天也支持自行配置 MCP 工具,见 官方 MCP 配置。部署完不会自动获得搜索或文件访问能力。接入见第 5 节。
本地推理没有云端 token 费用,但有电费和硬件成本。搜索 API 等外部工具可能另收费。
功率(千瓦)×使用小时数×每度电价格。例如 250W 用 8 小时、电价 0.6 元,约 1.2 元;实际功率需要测量。
适合离线使用、处理本地资料和大量重复任务。偶尔聊天、希望省事,也可以继续用云端。
先试整理笔记、分析一个代码文件或生成小工具,并人工检查。需要自动读文件、改代码时,再接 Agent。
参数大不代表每项任务都更强。用自己的常用任务比较正确率和完成时间,比只看参数量更有意义。
能辅助写游戏和网页代码,但仍需素材、测试与多轮修改。它不是原生视频生成模型,建议从一个小场景开始。
评论里的预测不能作为购买依据。先确定自己缺多少容量,再决定是否升级。
以下是安装和使用中常见的补充问题。
首次加载可能卡顿 1–3 分钟。若十分钟仍无进展,检查可用内存、磁盘和项目里的 strata-<model>.log 日志。
先核对地址和密钥,再在助手里发一个短问题。401 通常查密钥,404 优先查接口路径和客户端选用的协议;连接失败查 IP、端口、防火墙。
先检查是否已经启动一份 Strata。其他程序占用时可改用 --port 8081,客户端地址也要一起改。
不是。越长越占资源,读取也更慢;先用够完成任务的长度,长资料可以分段。超长上下文选项属于实验扩展。
可以,默认一次处理一个请求,其余排队。要并发可在配置中设置 "parallel": 2;12GB 卡上可能让单个回答变慢。v0.1.41 优化了多卡分层下的批处理,但需要相应的多卡和批处理设置,见 官方并发说明。
聊天默认在浏览器里,清除网站数据可能丢失;模型通常在项目旁的 Strata-data;配置和日志在项目目录。需要分别备份。
先停止服务,备份 strata-<model>.json 和自己修改的启动参数。
UPDATE.bat,Linux 运行 ./update.sh。它会更新代码、引擎、Python 依赖及已安装模型的设置,更新后不会自动启动;完成后再运行原启动入口。Strata-data;使用自定义目录时带上 --data-dir。git pull 可能失败。新版更新脚本会在没有已跟踪文件改动时保留备份分支并迁移;有改动则停止并给出提示。遇到旧脚本无法更新时,另下载最新版、保留原数据和配置,避免盲目重置。重新运行 setup 会覆盖它管理的设置;手动加在 args 中的引擎参数需核对并补回。详见 安装与更新。
资源下载完整后,基本本地推理可以离线。搜索、Agent 工具和远程服务可能联网发送数据,使用敏感资料前要核对这些工具。
先按显卡和系统内存选起步模型,再核对系统、驱动与磁盘空间。
| 项目 | 要求、配置或模型选择 | 注意事项 |
|---|---|---|
| 显卡 · NVIDIA(英伟达) | RTX 20、30、40、50 系列;推荐 12GB 及以上显存 | 8GB 能运行,但较慢 |
| 显卡 · AMD | RX 7900 XT/XTX、RX 7800 XT/7700 XT、RX 9060 XT、RX 9070/9070 XT、Radeon AI PRO R9700、RX 6800/6900 系列;推荐 12GB 及以上显存 | 部分型号由显卡所有者或社区报告验证,不代表作者逐卡测试 |
| 显卡 · 旧卡、Intel Arc、特殊核显 | 另有实验路径,需按对应文档配置 | 不作为本文的小白安装方案 |
| 多卡 | 支持两三张 NVIDIA 或多张 AMD 卡分担模型 | NVIDIA 安装器会提示选卡;AMD 通常需显式指定 --gpus,收益取决于配置 |
| 系统内存 · 32GB | 先选 Coder | 适合代码,中文和通用能力较弱;24GB 大显存卡另有低内存模式,可尝试 Q2_0/IQ2_XS |
| 系统内存 · 48GB | IQ2_XS,或偏重速度的 Q2_0 | 按用途选择版本 |
| 系统内存 · 64GB | 优先 IQ2_XS;有余量再试 IQ3_XXS/IQ3_S | 运行 IQ3_S 时少开后台程序 |
| 系统内存 · 96GB 以上 | IQ3_S,或 Unsloth UD-IQ4_XS | UD-IQ4_XS 下载约 94GB,当前 Unsloth 路径需 NVIDIA;64GB 也可用但部分专家读 SSD,会更慢 |
| 系统 | Windows 10/11 或 Linux | Ubuntu 22.04/24.04 的自动安装较完整 |
| CPU | 支持 AVX2 的 Intel/AMD 64 位处理器 | 预编译引擎要求;无 AVX2 的旧 CPU 自 0.1.39 起可尝试实验性本机编译,速度较慢 |
| 驱动 | NVIDIA 常规路径要求 580 或更新版本;AMD 使用对应驱动 | AMD 按官方文档核对 |
| 硬盘 | 优先 NVMe SSD;模型约 70–80GB,辅助文件约 6GB,看图再约 1GB | AMD Linux 环境可能另占约 10GB,部分 Q2_0 配置还会生成约 40GB 文件;安装前按所选版本预留空间 |
| 官方测试配置 · NVIDIA | RTX 5070 12GB+Ryzen 5 7600+64GB 系统内存 | 测试配置,不是最低要求;本文未注明系统 |
| 官方测试配置 · AMD | RX 9070 XT 16GB+Ryzen 9 3900X+47GB 系统内存;Linux | 测试配置,不是最低要求 |
Strata 硬件要求与模型选择
不确定时怎么选
这些模型名称是不同压缩版本。不确定就优先用安装器推荐项。显存和系统内存是两回事,不能直接相加判断能否运行。
让本地 Agent 帮忙部署
可把下面这段话交给电脑上的 Agent,让它按官方 AI_SETUP.md 检查显卡、内存和磁盘,再选择合适模型:
帮我在这台电脑上部署 Strata:https://github.com/Niko1221/Strata 。请先阅读仓库的 docs/AI_SETUP.md,检查硬件和可用空间,再安装、启动并说明客户端如何接入。
最大的痛点是几十 GB 的模型文件下载。这里提供整理的模型文件入口;先确认具体模型来源、版本和全部分片,再选择下面对应的安装方式。
模型文件下载入口
普通安装器支持的 GGUF 模型,可用 --gguf-dir 指向包含全部分片的目录。例如原版 IQ2_XS,在 Windows 项目目录执行:
START-HERE.bat --setup --family qwen --model IQ2_XS --gguf-dir "D:\models\IQ2_XS"Linux 对应命令:
./setup.sh --setup --family qwen --model IQ2_XS --gguf-dir /data/models/IQ2_XS把路径和模型换成实际下载的版本;Swift、Coder、Unsloth 的 family 也需对应。安装器仍可能下载引擎和 MTP 等辅助文件,下载了 GGUF 不等于已具备所有运行资源。拿不准时,用 START-HERE.bat --inspect "D:\models\实际文件.gguf" 检查文件内容和兼容性(Linux 换为 ./setup.sh --inspect)。
无审查版不是普通安装器菜单选项
如果文件是 OrcaRouter Uncensored IQ3_XXS,需按 官方 ORCA.md 手动流程 使用 tools/iq_pack.py --compat-bf16 转换并单独配置服务。不要改名冒充原版,也不要直接套用上面的 --family qwen 命令。官方验证针对 IQ3_XXS,不能推及其他量化版本;转换也不会恢复原始模型精度。建议新手先跑通安装器推荐的通用模型,再让 Agent 按该文档处理特殊版本。
下载并解压
下载项目 ZIP,完整解压,不能在压缩包内直接运行。
运行安装入口
双击 START-HERE.bat,按提示选择模型。第一次可以接受推荐项;要看图,需要开启 Images(图片功能)。
等待下载与启动
安装器会自动下载。中断后重新运行同一入口可续传。
打开聊天页面
访问 http://127.0.0.1:8080,先问一个短问题。
以后仍双击 START-HERE.bat 启动,关闭运行窗口停止服务。更换模型或修改设置用 SETUP.bat。
下载并进入项目目录
git clone https://github.com/Niko1221/Strata.git
cd Strata运行安装入口
./setup.sh按提示选择模型,等待下载和启动。AMD 也用这个入口,安装所需环境可能更久。
打开聊天页面
访问 http://127.0.0.1:8080,先问一个短问题。
Linux AMD 看图使用 CPU,Windows AMD 当前不支持看图。Linux 以后用 ./setup.sh 启动,改设置或加模型用 ./setup.sh --setup。
先运行 START-HERE.bat --check(Linux:./setup.sh --check)检查硬件。NVIDIA 可用 START-HERE.bat --calibrate(Linux:./setup.sh --calibrate)测量适合本机的设置,约需 15–30 分钟,慢卡更久;结束后会启动服务,不要再重复启动。AMD 当前不支持这项校准。
NVIDIA 多卡安装器会提示是否共同运行,也可显式传 --gpus 0,1;AMD 多卡需按 多卡说明 指定。留显存给桌面或其他软件可用 --vram-reserve-mib 2048。先保留默认优化,实验性加速开关不保证在所有配置上更快。
Thinking · 思考强度
简单问题先用 off/low,复杂任务再提高。先保证短问题能正常回答,再发长文或接助手。
A 是部署模型的电脑,B 是用来聊天的电脑或手机。两者需要在同一可互通的局域网,B 不用再下载模型。
关闭服务,备份配置
在 A 关闭服务,备份项目里的 strata-<model>.json 配置文件。
设置监听地址与密钥
Windows 在项目文件夹地址栏输入 cmd 并回车,执行下面命令。把密钥占位文字换成自己的长随机字符串:
START-HERE.bat --setup --host 0.0.0.0 --api-key "REPLACE_WITH_YOUR_LONG_RANDOM_SECRET"Linux 使用相同参数,把入口换成 ./setup.sh。
重新启动原模型
按提示选择原来使用的模型和设置,等待启动。
找到 A 的局域网 IP
在 A 执行 ipconfig(Windows)或 hostname -I(Linux),例如 192.168.1.100。
从 B 访问服务
B 打开 http://192.168.1.100:8080,填写刚才设置的密钥。
地址别填错
B 要填 A 的 IP。127.0.0.1 指当前设备自己,0.0.0.0 只是监听设置。
先检查 A 本机能否正常聊天、IP 是否正确、是否存在访客 Wi-Fi 隔离,再允许服务通过专用网络防火墙。不同地点的电脑需要另配远程访问方案。
在支持自定义模型的助手中填写:
http://127.0.0.1:8080/v1;另一台电脑填 http://A的IP:8080/v1。strata 或 /v1/models 返回的 ID。名称不会切换实际加载的模型。| 客户端协议 | 本机地址或请求路径 | 注意事项 |
|---|---|---|
| OpenAI Chat Completions | Base URL:http://127.0.0.1:8080/v1;请求:/v1/chat/completions | 普通聊天客户端通常选这一项 |
| OpenAI Responses | Base URL:http://127.0.0.1:8080/v1;请求:/v1/responses | Strata 0.1.39 起支持;客户端需启用 Responses 协议 |
| Anthropic Messages | 请求:http://127.0.0.1:8080/v1/messages;Claude Code 的 ANTHROPIC_BASE_URL:http://127.0.0.1:8080 | Base URL 不要重复追加 /v1/messages |
另一台设备把 127.0.0.1 换成 A 的局域网 IP,并填写服务密钥。Strata 的 Responses 实现是无状态的:客户端每次需发送完整历史,不支持 previous_response_id、后台任务或服务端保存回复。托管搜索等工具也不会由这个接口自动提供。详细限制见 官方 API 说明。
先验证,再接工具
先发短问题测试,再尝试读文件或改代码。聊天能连通但工具不能用时,还需检查助手是否支持对应的工具调用。
排错时附上这些信息
系统、CPU、显卡及显存、系统内存、模型名称和日志,密钥先遮盖。
让世界充满爱,peace!
安装要求、配置选项与版本更新
服务接口与日常使用
遇到问题时查看官方排错说明