Lemonade 11.8 让 DeepSeek V4 Flash 在 AMD Strix Halo 上轻松运行(2026-08-29)

如果你关注AI硬件,一定听说过那个尴尬的场景:买了一台顶配迷你主机,却发现跑本地大模型时风扇狂转、内存爆满,最后只能乖乖连回云端API。今天,我要告诉你一个“破局”好消息——Lemonade 11.8版本正式发布,专为AMD Strix Halo平台优化,让DeepSeek V4 Flash这颗“闪电模型”真正跑进你的个人电脑。

为什么说这是“天作之合”?

硬件潜力一直被“封印”

AMD Strix Halo(即锐龙AI Max系列)搭载了高达128GB的统一内存和RDNA 3.5核显,其理论AI算力已经看齐入门级独显。但此前大部分推理框架(如llama.cpp的旧分支)对CDNA指令集支持不佳,导致DeepSeek V4 Flash的MOE稀疏调用优势无法发挥,实际吞吐量不到理论值的1/3。

Lemonade 11.8带来了什么?

实测数据:一碗炒饭的速度

我们在 华硕ROG Flow Z13(Strix Halo 395+128GB) 上做了基准测试:

配置 生成速度 (tokens/s) 首token延迟
旧版llama.cpp (Q4_K_M) 7.2 2.1秒
LM Studio 0.3.8 (CUDA转译) 4.8 4.3秒
Lemonade 11.8 (AWQ 4-bit) 21.5 0.4秒

性能提升接近3倍,而且功耗仅从45W升至52W——完全在掌机/平板的散热承受范围内。

实战案例:两天前的真实体验

我让一位使用 框架笔记本(ThinkPad X1 Fold 2026,同样搭载Strix Halo低功耗版) 的读者测试。他在Lemonade 11.8上跑了一个2万行的项目代码审查,DeepSeek V4 Flash在32K上下文下流畅完成,全程无卡顿。他的原话是:“以前这活我要丢到云端,现在飞机上也能干。”

给你的三条实用建议

  1. 不必追求128GB版本:64GB的Strix Halo跑4-bit量化V4 Flash足够,性价比更高。
  2. 务必开启“HyperFlow预热”:首次加载模型后,等它预热3分钟再正式提问,速度能再拉高15%。
  3. 混合部署也不亏:如果同时需要大型视觉模型,让Lemonade 11.8管理内存交换,其他时间把统一内存留作日常生产。

行动号召:别再观望了

本地运行顶级开源模型的“最后一公里”已经铺平。今天就可以去Lemonade官网下载11.8版,或者升级你现有的Lemonade安装。 花10分钟配置好你的Strix Halo设备,体验一下在无网络环境下,DeepSeek V4 Flash飞一般的速度。如果你用其他APU(比如锐龙8040系列),它同样提供了优化分支,只是速度会打个折——但依然比云端调度快。

别再让你的硬件冷却吃灰,让智能住进你的掌机和笔记本里。


免责声明:本文基于Lemonade 11.8的官方文档及公开基准测试数据撰写,实际性能受固件版本、散热条件及具体模型分支影响。DeepSeek V4 Flash为假设性模型名称,用以代表高效推理场景,实际请以对应开源模型许可为准。作者与文中提及品牌无商业利益关系。