两周前我在这台 Mac 上跑 MiniMax H3,一条 15 秒的数字人视频要等 33 分钟,云端只要 7 分钟,我当时说本地认输。这周我把一半时间追回来了:同一张脸、同一段真声、同一天同一台机器,9 秒的片从 18 分钟压到 8 分钟,声音和口型都没打折扣。
▶ 视频直达:https://youtu.be/F526dZc7Jyg
先说结论:省了多少
同一张脸、同一段 9.13 秒真声、同一提示词、同一天同一电源档位:
- 原来的跑法:18 分 17 秒
- 改完之后:8 分 11 秒,省 55%
15 秒的长片也验了一遍:原来 35 分 51 秒,现在 14 分 56 秒。跟云端的 7 分钟比,差距从 5 倍缩到了 2 倍。
MiniMax H3 是什么
MiniMax H3 是一个能装在自己电脑上、不用联网的视频生成模型——给它一张脸、一段你的真声,它就能出一条会说话的你。我在 Mac 上跑的是一个专门为苹果芯片写的程序(不需要独立显卡)。
它为什么慢
模型出一条片,要把画面从一团噪点里一遍一遍地算清楚。原来的做法要算 12 遍,每遍一分多钟,加上开头结尾的固定开销,9 秒的片子就要 18 分钟。
怎么改:一个社区放出来的加速补丁
有人把这个模型重新训练了一版加速补丁——一个 1.4 GB 的小文件,教模型只算 4 遍就能把画面算清楚,别人在独立显卡上早就用上了。
但我用的这套 Mac 程序装不上补丁,唯一的办法是把补丁提前算进模型本体,另存一份——硬盘多占 62 GB,换来程序照常加载、不用改代码逻辑。
第一次翻车:一个数字差了 16 倍
加速补丁有一个强度系数,决定补丁往模型里加多少,文件本身没写清楚,我按最常见的默认值算了一遍。翻车了:画面糊成一团,你的声音都没了。
回头去查放出这个补丁的团队自己写的加载代码,才发现正确的系数是 0.0625,我之前按的默认值差了整整 16 倍——补丁力度太猛,直接把模型原本的能力盖过去了。
改对之后:声音和口型都没降级
系数改成 0.0625 之后重新跑,9 秒的片子 8 分 11 秒出炉。逐秒核对声音,和原声波形相关度 0.92–0.99,全程没有跑偏;口型比原来还准一点(用同一套粗测方法打分,改完是 0.246,原来是 0.180,数字越高说明嘴型和声音贴得越紧)。画面清晰度肉眼看不出差别。
本地跑还是上云端跑:三档判决
| 维度 | 本地 Mac(改完之后) | 云端 | 判决 |
|---|---|---|---|
| 速度 | 9 秒片约 8 分钟 | 约 7 分钟 | 云端小胜,但差距已缩到 2 倍内 |
| 花费 | 只费电,不限次数 | 按条计积分 | 要无限抽卡、反复试,选本地 |
| 隐私与联网 | 全程离线,素材不出门 | 要传素材、要联网 | 素材敏感、不想联网,选本地 |
简单说:想要最快、最清晰、一次过,上云端;不想联网、不想花钱、素材不能外传、或者要反复抽卡,留在本地——现在留在本地的代价,已经从「多等 5 倍」降到「多等 8 分钟」。
两个坑,提前说给你听
坑一:加速补丁的强度系数一定要去看训练团队自己怎么加载的,不能靠猜。差一个数量级,模型就从「提速」变成「全糊」,白白搭进去两条片的等待时间。
坑二:对比耗时必须是同一天、同一台机器前后脚跑出来的,不能拿昨天的慢和今天的快凑数。同一台 Mac 不同天的算力状态本身就会有 30% 左右的波动,跨天比较的数字没有意义。
换你,你的 Mac 跑一条 9 秒的数字人视频要几分钟?评论区报个数。
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论