1. 核心功能与产品特点
VOSR(Vision-Only Generative Model for Image Super-Resolution)是一款专为图像超分辨率放大与高清修复设计的生成式 AI 工具。
- 低清变高清修复:将模糊、低分辨率或压缩受损的图片进行高倍率放大,并智能重建出清晰自然的细节。
- 强力修复文本与细微结构:在处理包含文字(如屏幕截图、文档、指示牌)或密集纹理的图片时,能极大程度地保留文字的可读性和真实结构,不乱码、不扭曲。
- 秒级超快修复(单步生成):支持 VOSR 2.0 单步推理(1-step inference),仅需一次计算即可完成高清重建,大幅缩减生成等待时间。
- 超大图显存友好:内置分块(Tiled)推理机制,处理高分辨率大图时能有效控制显存占用,避免显存溢出(OOM)。
2. 研发团队与应用场景
- 研发团队:由香港理工大学(The Hong Kong Polytechnic University)与 OPPO 研究院(OPPO Research Institute)联合团队研发,研究成果已被计算机视觉顶级学术会议 CVPR 2026 接收。
- 应用场景:
- 旧照与低清图片修复:模糊老照片、网络低码率图片、画质受损图像的清晰化重建。
- 屏幕翻拍与文档增强:屏幕拍照(如 ScreenSR 场景)、文档截图及带文本标识图像的超清化处理。
- 高分辨率图像输出:摄影后期、设计修图及移动端影像的高清无损放大。
3. 底层核心技术
- 纯视觉 DiT 架构(Vision-Only DiT):基于 0.5B 和 1.4B 参数量的 Diffusion Transformer(DiT)骨干网络。
- 纯视觉特征引导:完全摒弃了传统生成式超分中对文本提示词(CLIP 文本特征)的依赖,采用 DINOv2 视觉特征与图像条件共同引导生成。
- 高效定制 VAE:0.5B 模型配备轻量化 SD2.1 VAE 解码器;1.4B 模型采用了抽离自 Qwen-Image 的 16 通道 2D VAE,大幅提升了图像解码效率。
- 单步蒸馏技术(1-step Distillation):通过模型蒸馏技术将多步扩散采样压缩至单步生成,实现超快推理。
4. 同类对比与核心优势
- 免除文本依赖,无“画面幻觉”:传统基于 Stable Diffusion 的超分工具易受文本提示词干扰而产生画蛇添足的“幻觉”变形;VOSR 采用纯视觉驱动,修复效果完全忠实于原图。
- 文字与细节还原度更强:相比 Real-ESRGAN 等传统非生成式超分,VOSR 生成丰富细节的能力更强;相比 SUPIR 等生成式超分,VOSR 对复杂文字与微小纹理的修复清晰度显著提升。
- 推理效率领先:多数生成式超分需要 20~50 步扩散采样,而 VOSR 2.0 仅需 1 步采样,具备极高的实际部署价值。