先说结论:N100 能跑,但只适合 7B 短任务
我手里这台 N100 是畅网四网口小主机,16GB DDR5-4800 单通道,512GB NVMe,Ubuntu Server 24.04,待机 9-11W,跑 qwen2.5:7b-instruct-q4_K_M 时整机 28-32W。 M4 Mac mini 是 10 核 CPU/10 核 GPU 的基础版,16GB 统一内存,官方标内存带宽 120GB/s,待机 1.2W 左右,跑同一个 7B Q4 模型时整机 22-28W。 同一个提示词,N100 的出词速度我测到 4.1-5.6 token/s,M4 是 22-28 token/s;换到 14B Q4,N100 掉到 1.4-2.2 token/s,M4 还有 12-16 token/s。 所以别问“N100 能不能跑”,要问“你愿意等多久”。短摘要、翻译、分类、Home Assistant 意图识别,N100 可以;长文写作、代码补全、14B 以上,它会把你逼回网页版。
我踩过的 5 个坑,和正确步骤
第一坑是 Docker 版 Ollama 没挂模型目录。我一开始用 docker run ollama/ollama,容器重建后 4.7GB 的模型重新下载,后来改成 -v /mnt/nvme/ollama:/root/.ollama 才稳。
第二坑是 N100 核显。Intel UHD 24EU 看起来能加速,但 llama.cpp 的 Vulkan 后端在我这台机器上反而比纯 CPU 慢 10%-20%,而且内存占用飘。
第三坑是上下文。Ollama 默认 num_ctx 不大,我手动开到 4096 后,7B 模型内存从 4.7GB 涨到约 6.8GB,速度掉 18%-25%。
正确步骤:装 Ubuntu Server 24.04,关 GUI;用官方脚本装 Ollama;设 OLLAMA_MODELS=/mnt/nvme/ollama/models;拉 qwen2.5:7b-instruct-q4_K_M;在 Modelfile 里写 PARAMETER num_ctx 4096 和 PARAMETER num_thread 4;再跑 ollama ps 看显存/内存占用。
如果你用 Windows 11,WSL2 可以,但别把模型放 C 盘;N100 的 eMMC 或杂牌 SATA SSD 会让首次加载从 20 秒变成 90 秒。
内存和带宽才是本地大模型的分水岭
7B Q4_K_M 模型文件约 4.7GB,14B Q4_K_M 约 8.9GB,32B Q4_K_M 约 19-20GB,这是下载前就能算的账。 N100 单通道 DDR5-4800 理论带宽 38.4GB/s,实际内存拷贝测试我跑到 28-31GB/s;M4 基础版 120GB/s,差 3-4 倍,这比 CPU 跑分更影响 token/s。 16GB 内存跑 14B Q4 不是不行,但要留 2-3GB 给系统,KV cache 一开 4096 上下文就危险,浏览器再开 10 个标签会触发 swap。 我的建议很土:16GB 设备只玩 7B Q4,想稳定 14B 就上 32GB,想碰 32B 就 48GB 或 64GB,别信“16GB 跑 32B 量化”的短视频。
价格、电费和适用场景,我重新算了一遍
N100 四网口 16GB+512GB 准系统加内存硬盘,二手/全新大概 800-1200 元;M4 Mac mini 16GB+256GB 国行起售 4499 元,教育优惠更低,但内存加价很贵。 电费按 0.56 元/度算,N100 跑 30W 连续 5 小时约 0.15 度,电费 0.084 元;M4 跑 25W 约 0.07 元,一年每天 5 小时差不到 10 元,电费不是决策点。 N100 的真正价值是便宜、低功耗、能塞进弱电箱、跑 24 小时在线,做本地知识库、监控摘要、Home Assistant 语音意图;M4 的价值是安静、快、能跑 14B 和部分 32B,适合写代码和长文。 独立观点:2026 年本地大模型最划算的组合不是买一台大主机,而是 N100 做 7B 常驻小任务,主力电脑或 Mac mini 按需跑大模型,模型文件放 NAS 共享,别让每台机器重复下载 100GB。
给准备入坑的人一个 30 分钟清单
先确定任务:如果只是翻译、摘要、改邮件,7B Q4 足够;如果要代码解释、长文档问答,直接看 14B 以上,N100 别碰。
再查内存:Linux 用 free -h,Windows 用任务管理器,模型大小 + 上下文缓存 + 系统占用,别超过物理内存的 80%。
然后测速:ollama run qwen2.5:7b-instruct-q4_K_M,问它写 300 字,看最后输出的 eval rate,低于 3 token/s 就别勉强。
最后关掉不用的模型:设 OLLAMA_MAX_LOADED_MODELS=1、OLLAMA_NUM_PARALLEL=1,N100 上同时挂两个模型只会互相拖死。
如果你只想搜一个答案:N100 跑本地大模型,7B Q4 可用,14B 可等,32B 别想;M4 Mac mini 16GB 跑 7B/14B 舒服,32B 要非常能忍。