Skip to content
VOSR

VOSR

纯视觉单步生成式图像超分模型,主打秒级极速推理与卓越的文字及细微结构清晰修复

使用魔当PC客户端下载

应用特点

开源图片

系统要求

最低16GB内存。预留足够硬盘空间,建议20GB以上。
Windows 10/11:显卡NVIDIA,8GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

1. 核心功能与产品特点

VOSR(Vision-Only Generative Model for Image Super-Resolution)是一款专为图像超分辨率放大与高清修复设计的生成式 AI 工具。

  • 低清变高清修复:将模糊、低分辨率或压缩受损的图片进行高倍率放大,并智能重建出清晰自然的细节。
  • 强力修复文本与细微结构:在处理包含文字(如屏幕截图、文档、指示牌)或密集纹理的图片时,能极大程度地保留文字的可读性和真实结构,不乱码、不扭曲。
  • 秒级超快修复(单步生成):支持 VOSR 2.0 单步推理(1-step inference),仅需一次计算即可完成高清重建,大幅缩减生成等待时间。
  • 超大图显存友好:内置分块(Tiled)推理机制,处理高分辨率大图时能有效控制显存占用,避免显存溢出(OOM)。

2. 研发团队与应用场景

  • 研发团队:由香港理工大学(The Hong Kong Polytechnic University)与 OPPO 研究院(OPPO Research Institute)联合团队研发,研究成果已被计算机视觉顶级学术会议 CVPR 2026 接收。
  • 应用场景
  • 旧照与低清图片修复:模糊老照片、网络低码率图片、画质受损图像的清晰化重建。
  • 屏幕翻拍与文档增强:屏幕拍照(如 ScreenSR 场景)、文档截图及带文本标识图像的超清化处理。
  • 高分辨率图像输出:摄影后期、设计修图及移动端影像的高清无损放大。

3. 底层核心技术

  • 纯视觉 DiT 架构(Vision-Only DiT):基于 0.5B 和 1.4B 参数量的 Diffusion Transformer(DiT)骨干网络。
  • 纯视觉特征引导:完全摒弃了传统生成式超分中对文本提示词(CLIP 文本特征)的依赖,采用 DINOv2 视觉特征与图像条件共同引导生成。
  • 高效定制 VAE:0.5B 模型配备轻量化 SD2.1 VAE 解码器;1.4B 模型采用了抽离自 Qwen-Image 的 16 通道 2D VAE,大幅提升了图像解码效率。
  • 单步蒸馏技术(1-step Distillation):通过模型蒸馏技术将多步扩散采样压缩至单步生成,实现超快推理。

4. 同类对比与核心优势

  • 免除文本依赖,无“画面幻觉”:传统基于 Stable Diffusion 的超分工具易受文本提示词干扰而产生画蛇添足的“幻觉”变形;VOSR 采用纯视觉驱动,修复效果完全忠实于原图。
  • 文字与细节还原度更强:相比 Real-ESRGAN 等传统非生成式超分,VOSR 生成丰富细节的能力更强;相比 SUPIR 等生成式超分,VOSR 对复杂文字与微小纹理的修复清晰度显著提升。
  • 推理效率领先:多数生成式超分需要 20~50 步扩散采样,而 VOSR 2.0 仅需 1 步采样,具备极高的实际部署价值。