ChengRang

为什么现在一直没有好用的 AI 生 PSD 工具

人人都能懂的科普 约 12 分钟阅读

你有没有遇到过这种情况,让 AI 生成一张海报,图很好看,但你想把标题换个字,或者把右下角的 logo 换一换,就不好办。图是画死的,改一个字都要重新生成,运气好出一张新的,运气不好整张图都改崩了。

设计师朋友更熟悉一个场景,客户发来一张 JPG,说原文件丢了,帮忙把产品往左挪五厘米。你盯着那张图,知道接下来要在钢笔工具和修补工具之间来回折腾。

有人会说,现在 AI 这么强,直接把图丢给它改字不就行了。这样也确实可以,改个错别字、挪个东西,几十秒就出结果,很多人已经在这么干。但它有它的缺点,后面单独讲。

如果 AI 能直接给出一个 PSD,这些痛苦就全没了,也不用再把图丢给 AI 赌运气。PSD 是 Photoshop 的工程文件,里面每个元素都是活的,文字图层都能改,背景也能换。

奇怪的是,AI 画画已经这么强了,能产出 PSD 的工具却一直不好用。原因其实在 PSD 这个东西本身。

PSD 到底是个什么东西

PSD 确切来说是一个编辑状态。

JPG 和 PNG 保存的是画好的成品,每个像素的值都定死了。PSD 保存的是怎么做出来的。你可以把它想成一叠透明胶片:人物一层、背景一层、文字一层,每一层都是独立的一张,而且每一层都能修改,叠在一起才是完整画面。想换背景,只动背景那张,想改字,只动文字那张。

这个透明胶片的结构,恰恰是过去的 AI 学不会的东西。

PSD 里不只有图片。文字层存的是真正的文字,字体、字号、字距、行距都是参数,随时能改。还有智能对象,里面嵌着原始素材文件。这些东西是活的。

所以 PSD 是一份分层的、每个部分都能单独编辑的工程文件,是设计师工作台状态的存档。JPG 是端上桌的成品菜,PSD 是厨房里切好的食材。

为什么 AI 不能直接生成 PSD

现在的 AI 画画,本质是在画一张完整的图。它脑子里只有像素,不知道什么是图层、什么是蒙版、什么是文字层。让它生成 PSD,等于要求一个只会画完整画作的画家,交出一份带分层的工程文件。他画得再好也交不出来,因为他根本没学过图层是什么。

另外还有技术上最硬的一道坎,是被挡住的部分得凭空补出来。一张成品图里,前景挡住的那块背景根本不存在任何像素,你把人物抠成一层,人物身后那片区域在原图里是空的,模型必须自己想象出来。这件事在研究上叫非模态补全,是个独立的难题,如果补得不干净,挪开元素就会露出一块补丁。市面上的拆图工具效果参差不齐,大半都跟这个有关。

还有一点是教材。要教会 AI 分层,得有海量真实 PSD 当样本,可 PSD 是设计师的工作资产,网络上能看到的是导出的成品图,工程文件躺在本地硬盘和公司服务器里,没人往外传。市面上到处都是成品菜的照片,带步骤的菜谱少得可怜。学做菜没有菜谱,再聪明的孩子也学不会呀。

最后是打分。AI 生成一张图好不好,电脑有自动评分标准。但一个 PSD 分得好不好,图层分得对不对、文字是不是活的、蒙版干不干净,电脑目前不会判断,只能靠人一双眼睛去看。没有自动评分,训练和迭代就像蒙着眼开车。

至于 PSD 这个格式本身,它确实很复杂。1990 年的格式,三十多年里不断加功能,整个结构像一套反复装修的老房子。但它反倒是这里面最不成问题的一环,因为 Adobe 公开过格式规范,psd-tools 这类开源库已经能读能写,Photopea 更是直接在浏览器里打开 PSD。难的不是把文件封装成 PSD,而是先要生成正确的图层内容往里装。

要做文生 PSD,需要准备什么

如果真的要做,根本不需要 AI 直接吐 PSD。

做法是加一道翻译,先定一套图层说明书,AI 学写说明书,写完再由程序把说明书翻译成 PSD。

这套说明书是地基,它要能描述有哪些图层、每层什么内容、放在哪、谁压着谁,还要能被程序翻译成 PSD,也能被画成图拿来检查。

然后是教材库。收集真实 PSD,用解析工具把它们拆开,翻译成说明书格式,再清洗整理。图层必须可编辑,不能拍平成图案,这一步直接决定最终产品的天花板。

最后是模型这一层,分析整个画面分几层、每层放什么、顺序怎么排,文字内容走文字通道生成,保证出来的是活字,需要画的部分再交给画图模型逐层画,画的时候还要知道这一层被谁挡着。

生成出来还不算结束,得放进 PS 里让人编辑得动。

现在有哪些工具,各是什么原理

市面上能产出 PSD 的东西,基本可以分成三档。

最弱的一档是拆图派。原理是把一张成品图用 AI 语义分割,拆成几层 PNG,再打包成 PSD。每一层是独立图片,但字是画的不能修改。代表是 Image2Layer,上传图片自动拆出主体、文字、阴影、背景,还能补全被遮挡的背景,移走物体不留洞。适合救急,不适合交付。

中间一档是端到端派(端到端的意思是一步到位,不像拆图派那样先画完再拆,而是模型一次就把分好层的东西直接生出来),这是最近一年最大的变化。阿里在 2025 年 12 月开源了 Image-Layered,它不再生成单张图,而是直接吐出多个带透明通道的图层,改一层不影响其他层,输出能直接存成 PSD。它的训练教材就是从真实 PSD 里提取的,这也印证了前面说的,教材库才是这个方向的真瓶颈。同类还有 LayerDiffusion,能生成带透明背景的图,但要自己拼。

这一档要注意一件事:它分的是画面里的物体,不是文字。这类模型输出的是带透明通道的像素图层,所以你拿到的 PSD 里,标题和正文仍然是画上去的图案,点不动,改不了。它解决的是挪位置、换背景、单独调某个元素这类需求。

最稀缺的是文档派,文字是真正的活字。Veeso 把输入的文字解析成信息层级,映射成多图层设计,导出 PSD 或 PPTX,文字准确且可编辑。国内接近的是 Seede AI,输入文案直接转成可编辑设计源文件,每行文字独立图层,也能导出 PSD、PPT、PDF。

文档派的强项和短板都很明显。它本质是内容驱动的排版引擎,先理解你的文案有几个层级,再套版式排出来,所以海报、长图、PPT、易拉宝这类结构化的东西做得又快又准。但你想要一张自由构图的艺术插画,它给不了,那种活还得回到画图模型。选它只是因为要能改字,不是因为它画得更好。

还有几个不能漏的。Adobe 官方 Firefly 的批量去背景功能支持分层 PSD 输出,是官方第一次给这个能力定价。美图 WHEE 生图后能看分层并导出 PSD。Photopea 是免费在线 Photoshop,自带 AI 分层,最适合当验货工具;也有人拿 GPT 生图加推理模型拆图,属于野路子,能跑通但不稳定,看脸。

直接丢图给 AI 改,缺点在哪

开头说的直接把图丢给 AI 修改那条捷径,改图模型会盯着那一小块画面,凭感觉把旧字盖住,再凭感觉把新字画上去。盖和画,全是猜的。它和拆图派是同一套哲学,把一切当像素处理,只是把拆和拼两步换成了直接重画。

这条路绕开了生成 PSD 的难题,放弃的是可编辑性。

改完的字还是像素,不是字。模型把文字当图形来模仿,汉字笔画多、结构密,还有笔锋和衬线这些细节,经常把笔画画错,缺一笔多一笔,或者干脆四不像。这次运气好改对了,不代表下次还对,因为每次都是重新猜。你想接着换个字体、调个字号,又得重来一轮。

改一次,整张图被重新理解一次。虽然你只让它动一小块,但为了融合得自然,很多模型会把周围一大片一起重画。改了字,旁边颜色跟着变,阴影位置飘了,相邻的元素被顺带改掉。改一次两次看不出,连着改三五次,整张图会慢慢走样,像一张照片被反复复印。

最让设计师头疼的是没有微调,只有重画。在 PSD 里,字号大两号、颜色深一档、logo 往左挪五厘米,都是参数操作,不满意随时撤销。改图模型里不存在这种操作,你只能说再画一版,标题大一点,然后它重新画一次,结果是不是真的大了,看运气。设计师改稿最日常的流程,恰恰是这条路最不擅长的。

它也不给你版本历史,只留下改前和改后两张图,中间过程不保留,想回到第二次改完的那版,回不去。而改稿这件事,本质就是在版本之间来回跳。时间成本也不低,改一个错别字抽两三次才成功很正常,每次都要等模型生成,改五个字花的时间比手动修要久。局部重绘还经常在低分辨率下干活,重画出来的区域和周围一比明显发虚。

那这条路什么时候该用?适合一次性快修。海报里有个错别字,改完就交付,不再动它;或者抹掉背景里的电线杆、换一张脸、去掉画面里多余的人。这类需求,改图 AI 又快又好,是神器。不适合任何你预感到还要继续编辑的场景,只要你有改完这处还想再调那处的需求,或者要交给客户一个能继续改的源文件,像素级改图就是无底洞,你会在一次次的重新生成里耗尽耐心和 Token。

改一次是快修,改十次就是灾难。这条路的终点还是要回到分层,回到真图层结构,只有那里,改字才真的只是改字。

到底该怎么选

普通人如果只是要一张能改字的海报,优先选文档派,生成完文字还能编辑。如果你要的不是改字,而是把画面里的元素拆开来挪位置、换背景,那走 Image-Layered。如果只是临时改个错别字、抹掉画面里碍眼的东西,直接把图丢给改图 AI 就行,这是它擅长的活。

想自己搭工具的工程师,开源栈有现成,Image-Layered 负责分层,psd-tools 负责写 PSD,几天能出原型,卡点在数据清洗和图层验证,总之生成的 PSD 设计师目前是不满意的。

也许完美的 AI 生 PSD 工具,可能比我们想象中来得快。到那时候,设计师头疼的改字挪图,也许真的只是一句话的事,而且是改完还能再改的那种一句话,不像今天,每次修改都是重新赌一次。

但也有一种可能,在 AI 高速发展的时代,PSD 这种手搓工作流程,或许会被淘汰。

← 返回目录