以前部署 AI 模型是什么体验?翻文档、敲命令、改 JSON、查报错、改完再报错、再查报错。现在不一样了,AI 能帮你部署 AI。这篇文章记录的是我用 WorkBuddy 从零跑起 H3 的全过程,全程没写一行代码,没手动改一个 JSON。
01 先看你的机器配置
H3 不是小模型,我们要本地自己玩的话:
- 显卡:最低 24GB 显存,推荐 RTX 4090 或 3090
- 内存:最低 64GB,推荐 128GB以上
- 硬盘:75GB 空闲空间,最好 NVMe SSD
- CUDA:12.4 以上,越新越好
显存不到 24GB 的朋友,体验会非常差。H3 模型权重 21GB,文本编码器 27GB,加起来快 50GB,但不是说你需要 50GB 显存。ComfyUI 会把模型分页加载,用的时候搬进显存,用完挪到内存,靠 24GB 显存加 64GB 内存配合着跑。低于这个配置真跑不起来,等后面出更激进的量化版本再看。
另外 H3 有两种量化版本:NVFP4 和 INT8。NVFP4 体积小但只有 RTX 50 系支持,4090 及以下只能用 INT8。不过你不用自己查这个,告诉 WorkBuddy 你的显卡型号,它自己会选对。
02 装好 WorkBuddy 和 ComfyUI
WorkBuddy 去 workbuddy.cn 下,跟装微信差不多,下一步下一步就完事了。装完打开,把工作目录指向你的 ComfyUI 目录。
ComfyUI 还没装?也不用查教程。直接跟 WorkBuddy 说一句:帮我在 E:\AI\ComfyUI 安装 ComfyUI,我的显卡是 RTX 4090。它会帮你 git clone 仓库、建 Python 环境、装依赖、检查 CUDA,一条龙跑完。你等就行。
WorkBuddy 底层能直接跑命令行、读写文件、装软件包,所以安装、改配置、改启动脚本这些活它都能干。
03 H3 是什么
简单说,MiniMax H3 是个音视频同步生成的模型,你给它文字或图片,它吐一段带声音的视频。安装好以后,你就有了一个本地可以做视频的工具。有几种玩法:
- T2V:纯文字生视频
- I2V:给一张图加文字,生成视频
- R2V:给一张参考图加文字,生成视频,而且能保持参考图里的人脸不变。想锁脸的选这个
三种模式共用文本编码器和 VAE,但 DiT 模型是不同的,所以得下两份。
04 让 WorkBuddy 帮你下模型
75GB 的东西,手动下得找半天路径。直接跟 WorkBuddy 说:显卡 RTX 4090,帮我从 ModelScope 下载 H3 全部模型到 ComfyUI 目录,用 INT8 版本。它自己会装 modelscope,然后往正确的目录里塞 5 个文件:
- 视频 VAE(5.21 GB),放 models/vae/
- 音频 VAE(0.61 GB),放 models/vae/
- 文本编码器 INT8 版(27.14 GB),放 models/text_encoders/
- T2V/I2V 模型 INT8 版(20.97 GB),放 models/diffusion_models/
- R2V 模型 INT8 版(20.97 GB),放 models/diffusion_models/
最后那个 R2V 模型只有锁脸功能才用得上,不想要的话跟 WorkBuddy 说只下前四个就行。
下载中途断了也不怕,ModelScope 支持断点续传,重新跑一遍命令会接着下。75GB 正常十几分钟到几小时,取决于你的网速,期间你可以问 WorkBuddy 下载到哪了,它会去看临时文件大小告诉你。
05 让 WorkBuddy 帮你改工作流
ComfyUI 其实自带了 H3 的官方工作流模板,不用额外装插件。但有个坑:模板默认用的是 NVFP4 版本,5090以下跑不了,得改成 INT8。
手动改也简单,在画布上找到 CLIPLoader 节点,点下拉框选 INT8 那个文件就行。当然既然有 WorkBuddy,直接说一句更省事:把 H3 官方工作流模板里的文本编码器从 NVFP4 换成 INT8。它在 JSON 里找到对应字段改掉,保存,完事。三个模板都能改,说一句"三个模板都改了"它就一次处理完。
模板对应关系:
- video_minimax_h3_t2v:文生视频
- video_minimax_h3_i2v:图生视频
- video_minimax_h3_r2v:参考图生成,锁脸用的
06 参数怎么设
H3 的帧数有个奇怪的规矩,必须满足 17k+5 这个公式,填别的数直接报错。常用的几个:
- 22 帧,大概 0.9 秒,拿来快速试效果
- 124 帧,大概 5.2 秒,日常推荐
- 362 帧,大概 15 秒,最长了但显存压力大
分辨率方面,720p以下都可以拿来测试玩,1080p 实际测试半天才 5% 进度,显存紧的话别碰。
Step 数默认 30 步够用了,想快点可以压到 20,质量差别不大。
这些参数你不用记,生成之前问 WorkBuddy 就行,比如"我要 680p 出 5 秒视频,参数怎么填",它直接告诉你。
07 怎么用 WorkBuddy 处理各种遇到的问题
方法就一句话:告诉 WorkBuddy 就行。
跑着跑着变慢了。 第一次生成挺正常,第二第三次开始卡,越跑越慢。把这句话发给 WorkBuddy:"跑 H3 越跑越慢什么原因?"它会去翻 ComfyUI 的内存管理代码,告诉你 CUDA 显存碎片化了,缓存没清。解决办法很简单:每跑两三次点一下画布上的 Free Model 按钮。或者让 WorkBuddy 帮你在启动脚本里加上一些参数,它会更积极地卸载模型释放显存。
SageAttention 报错。 用了社区一个叫 Easy 的工作流,蹦出来 SageAttention version too old 的错。贴给 WorkBuddy,它告诉你:Easy 工作流里有个 SageAttention Patch 节点要 2.x 版本,但 Windows 上 pip 装的只有 1.0.6。想升级得自己拿 CUDA Toolkit 编译源码,很麻烦。两个选择,要么把那个节点从 JSON 里删了,要么换官方工作流。官方模板根本没这个节点,所以直接用官方的就完事。
图生视频人物脸崩了。 给一张人脸照片做图生视频,结果视频里人脸歪了,越来越不像原图。这个坑比较深。问了 WorkBuddy 才知道,I2V 模式下参考图虽然参与每层计算,但它的时序位置锚定在第一帧,越往后的帧离它越远,注意力自然衰减,跑着跑着脸就歪了。R2V 不一样,参考图有独立的时序位置,在每一层 attention 里都能被所有帧平等关注到,所以能全程锁住脸。解决办法就是切到 R2V 模式。
Easy 工作流比官方慢太多。 让 WorkBuddy 装了社区那个 Easy 插件试试,结果生成速度肉眼可见地慢。WorkBuddy 去读了 Easy 节点的源码,发现两个问题:一是它有个 IS_CHANGED 函数返回 nan,导致每次都重新算 conditioning;二是所有模型绑在一个 bundle 里,显存余量不够。结论就是用官方工作流,别折腾 Easy 了。
08 R2V 锁脸:告诉 WorkBuddy 你要什么,它给你生成
前面说了,I2V 会崩脸,R2V 不会。但 R2V 的参数怎么调?不用自己研究,跟 WorkBuddy 说:帮我基于官方 R2V 模板做一个锁脸工作流,用 INT8 模型,参考图分辨率设成 max,只要一张参考图。它会读取官方模板,改好文本编码器,把 ref_image_size 从 match 改成 max,删掉多余的第二张参考图节点,存成一个新 JSON。拖进 ComfyUI 就能用。
有人可能担心 R2V 更吃显存。我让 WorkBuddy 翻了模型源码的 PackedLayout 类,参考图只占 1 帧的空间 token,而视频有上百帧,占比不到 1%,跟 I2V 差不多。
唯一要注意的是别在同一个会话里来回切 I2V 和 R2V,不然两个 21GB 模型可能同时赖在显存里不走。切换之前点一下 Free Model。
09 性能优化
同样一句话的事:H3 跑得有点慢,有什么办法?WorkBuddy 会根据你的配置给建议。无非就是这几点:每跑两三次 Free Model 一下;显存紧就加 --lowvram 启动;别同时加载两个模式的模型;测试用 720p 出图用 1080p;Step 压到 20。让 WorkBuddy 直接帮你改启动脚本加参数也行,不用自己翻配置文件。
10 总结
整个过程其实就是不停跟 WorkBuddy 说话,它在旁边干活。从零到出第一个视频用不了多长时间,主要是等模型下载和加载。前提是 ComfyUI 和 Python 环境已经就绪,如果从零装 ComfyUI 还得额外加十几分钟。全程没写代码,没改 JSON,没搜报错。有问题先问 WorkBuddy,它真的能直接读你本地的代码和文件来排查问题,这个搜索引擎做不到。