结论先行:多模态大模型不会消灭图像修复,但会把它从「前台明星」挤到「产线里的专用工位」。碰不到预训练集群的图像算法工程师,短期不必硬挤「训下一个 GPT」,更现实的出路是:扎进水位更深的垂直场景、把大模型当编排层而不是当唯一算子、以及把「评测—数据—部署」做成别人替不掉的工程能力。
一、先拆一句流行叙事
这两年最常见的说法是:「一个多模态大模型,理解 + 生成 + 编辑,端到端搞定。」
从融资故事和产品 Demo 看,这话没全错。但从已经跑起来的产线看,它漏了半句:大模型擅长「能出图、能对话、能试」,不自动等于「每张图都稳、每帧都省、每个机型都实时」。
图像修复这条线——超分、去噪、去雨、去雾、低光、压缩伪影、RAW 域处理——在 2026 年并没有消失,而是在换座位:
兼并的是「用户入口」和「工作流编排」;没兼并的是「在硬约束下把画质修到可交付」。
二、传统图像修复模型,三条还没被收编的出路
出路 1:产线深水区——大模型不愿长期泡的地方
多模态模型的商业逻辑是:通用能力 + 规模化推理。图像修复在产业里真正值钱的,往往是反过来的:窄场景 + 硬指标 + 长尾约束。
典型例子(也是你这半年流水线里反复出现的方向):
相机 RAW / ISP:信号相关噪声、暗帧、ISO 标定、跨传感器泛化——2-Shots 这类方法解决的是「训练数据从哪来」,不是「再套一层 diffusion」。 压缩域增强:直播、云游戏、CDN 边缘要从 H.264 码流里拿 MV、残差图做 online VSR——CDA-VSR 路线吃的是「有码流元数据」这门手艺,通用多模态 API 通常碰不到这一层。 未知噪声水平 / 实例退化:CANC 估 σ、TTTIR 在推理时做实例级状态演化——说明「静态权重吃不透每张图」仍是真问题,专用模块仍有指标空间。
判断标准很简单:若你的场景同时满足「延迟敏感 + 数据不能出域 + 退化可物理描述」,专用小模型往往比「调一个 20B 多模态」更划算。
出路 2:从大模型的「下游工位」变成「质量闸门」
AIGC 降本的一条主路径已经很清楚:低清批量试错 → 定稿 → 再增强交付。超分/修复在这里不是炫技,是账单开关——高清算力只花在会被观众看见的版本上。
这意味着传统修复模型的价值公式变了:
旧:PSNR 高 0.1 dB → 发论文新:同样完播率下,生成成本降 60%–80% → 客户续费
工程师要做的,不是证明「我比 GPT-Image 更会画画」,而是证明:我懂生成失真(纹理塌陷、时序闪、平台二次压缩),能在产线里把废稿率和返工率压下去。
出路 3:评测与数据——大模型越万能,越需要「裁判」
多模态一统江湖之后,会出现一个悖论:生成更容易,验收更难。
Bridging the Perception Gap 这类工作已经在说:GT 本身可能不如扩散输出「好看」,PSNR 甚至和人类偏好负相关。行业接下来缺的不是「又一个更大的生成模型」,而是:
任务相关的 IQA / 偏好对齐 / 回归评测 合成退化管线(物理噪声、传感器噪声、压缩链) A/B 与线上指标(完播、投诉率、退货率)
专用修复模型不会死,有一部分会进化成「可解释的质检器 + 可控的后处理算子」。
三、碰不到大模型预训练的图像工程师,实际在干什么?
很多人把「接触不到大模型训练」等同于「没前途」。工程现场更接近下面四张工牌——没有一张写着「躺平」,也没有一张写着「必须自己训 70B」。
工牌 A:数据与退化工程师(最缺人、最抗裁)
在做什么:
建 RAW→sRGB、压缩→二次压缩、平台转码链 的合成数据 维护 dark frame、标定表、机型 LUT、ISP 参数表 把论文里的 Poisson-Gaussian、谱采样、σ 估计,落成可复现的数据工厂
为什么大模型替代不了:通用预训练不吃你的传感器噪声分布;数据契约才是壁垒。
工牌 B:部署与算子工程师(NPU/GPU/端侧)
在做什么:
INT8/FP16 量化、算子融合、Tile 推理、显存预算 在 30ms/帧 或 93 FPS 约束下做 online VSR 把 0.79M 的 TTTIR、0.78M 的 CANC 类模块嵌进现有管线
为什么仍值钱:多模态 API 的延迟和成本结构,撑不起直播主路或手机预览路。
工牌 C:系统集成与编排工程师(离 Agent 最近)
在做什么:
大模型负责:意图理解、分镜、文案、粗修、选风格 传统模块负责:人脸锐化、去块、去雨、超分、色彩一致性 用 工作流 / MCP / 规则引擎 把二者串起来,并做失败回退
这就是你 IP 里说的CV → Agent:不是抛弃修复,而是修复变成 Agent 工具箱里的一个 Tool。
工牌 D:垂直场景交付工程师(ToB 真正买单的人)
在做什么:
监控、工业视觉、医疗影像、文档扫描、电商素材——每个都有合规、稳定性、可审计要求 交付物是 SDK + SLA + 回归测试集,不是 HuggingFace 上一个 Demo
大模型可以当 Copilot;签字负责的往往还是专用管线。
四、一张图:未来三年的分工草图
用户入口 / 创意编排 → 多模态大模型(理解、生成、编辑意图)↓质量闸门 / 硬约束修复 → 传统专用模型(超分、去噪、去块、RAW、码流域)↓评测 / 数据 / 部署 → 图像算法工程师的主战场
不是「传统 vs 大模型」,是「编排层 vs 算子层 vs 工程层」。多数工程师本来就在第三层;只是第三层的名字从「调参」变成了「数据契约 + 评测 + 工具编排」。
五、反直觉点
1. 多模态越强,小模型反而可能更多。大模型负责「80 分通用解」;为了最后 15 分和那 5 分稳定性,产线会叠一串专用模块——就像视频编码里从来不是「一个算法通吃」。
2. 「碰不到预训练」不一定是劣势。预训练团队拼的是集群和卡时;垂直团队拼的是场景数据、客户指标、上线周期。两条赛道,考核表不同。
3. 最危险的不是不会训大模型,而是用 2022 年的地图找工作。还在只刷无压缩 LR 榜、不接 AIGC 失真、不接压缩码流、不接端侧 SLA 的简历,会比「没碰过大模型」更快碰壁。
4. 转型不等于转去训 LLM。更顺的路径往往是:修复工程师 → 质量工具开发者 → 多模态工作流里的「画质 Tool 负责人」——仍然是你熟悉的像素,只是调用方从 forward() 变成了 Agent 的 function call。
六、给不同处境的一句建议
七、收束一句
多模态大模型在兼并的是**「用户以为一个按钮就够」的幻想**;传统图像修复在守住的是**「在已知约束下把画质修到可交付」的底线**。
碰不到大模型训练的图像算法工程师,并不是被时代抛下——只是舞台从「论文首页」挪到了「产线第三层」。那里照样需要人:谁来做噪声标定、谁来做 93 FPS 的码流增强、谁来告诉 Agent「这张图不能这么修」。
你在哪个工位上——数据、部署、编排,还是垂直交付?更担心被大模型替代,还是担心团队还在用 2022 年的选型标准?评论区说说你的场景。
关注「掌上小科技」行业观察系列:少被叙事带着跑,多看产线里谁在真金白银买单。


