BiRefNet:高精度图像分割的新标杆

BiRefNet
BiRefNet

在计算机视觉领域,图像分割技术一直致力于让机器“看懂”图像——将数字图像中的不同物体精准地分离出来。随着高分辨率影像设备的普及,高分辨率二分图像分割(DIS) 成为了一项关键技术,广泛应用于电商抠图、人像编辑、设计素材准备等场景。然而,传统分割方法在处理发丝、镂空网格、透明物体等精细结构时常常力不从心。

由南开大学等机构的研究团队提出的BiRefNet(双边参考框架),为这一难题提供了全新的解决方案,并在多项任务中达到了行业领先水平。

核心思想:双边参考,双管齐下

BiRefNet的核心创新在于其独特的“双边参考”架构。不同于传统模型仅依赖单一输入进行预测,BiRefNet设计了一个精巧的双模块系统:

  • 定位模块:负责利用全局语义信息锁定目标物体的位置。它基于视觉变换器(Vision Transformer)提取层次化特征,为后续的精细处理划定大致范围。
  • 重建模块:这是BiRefNet的精髓所在。它引入了“内向参考”和“外向参考”两种机制,如同两位“监督员”协同工作。
    • 内向参考:直接使用原始高分辨率图像作为指导。传统方法往往为了计算方便而将图像缩放到较低分辨率,导致细节丢失。BiRefNet则保留了原始图像,确保发丝、网格等微小像素特征得以完整保留,作为重建的“源参考”。
    • 外向参考:引入梯度图作为目标参考。梯度图能清晰勾勒出图像中颜色或亮度剧烈变化的区域(即边缘和细节)。通过这种方式,模型会被“监督”着去更加关注那些细节丰富的区域,从而显著提升边缘的锐利度和准确性。

性能表现:业界领先的抠图效果

得益于这种创新的架构,BiRefNet在处理高分辨率图像时展现出了惊人的精度。研究团队表示,它已经成为目前开源和商用领域前景物体提取效果最好的模型之一

在实际应用层面,BiRefNet已经衍生出针对不同场景的多个专业化版本:

模型变体核心特点适用场景
BiRefNet_HR支持高达2048×2048分辨率推理,细节保留能力极强高清图像抠图,对边缘锯齿、透明物体(如玻璃)有优化
BiRefNet-matting针对镂空、透明、发丝等数据进行专项训练发丝抠图、玻璃杯等透明物体的精细分离
BiRefNet-portrait专为人像抠图任务优化人像背景替换、视频会议虚拟背景等场景
BiRefNet-lite轻量级版本,推理速度更快对实时性有要求的应用,部分型号在1024×1024分辨率下可达30帧/秒的处理速度

广泛应用:从创意设计到工业检测

BiRefNet的高精度分割能力使其在多个领域大放异彩:

  • 创意设计与电商:已被集成到ComfyUI等Web应用中,成为稳定扩散(Stable Diffusion)图像合成任务中表现最佳的抠图节点。电商产品图、广告素材的背景去除变得轻而易举。
  • 人像与视频处理:被广泛用于图像和视频中的人像分割。
  • 工业与安防:凭借其捕捉微小细节的能力,它甚至能精准地检测墙面裂缝,用于建筑维护评估;也能准确提取具有细密网格和密集孔洞的物体。

未来展望

研究团队表示,他们的目标是让BiRefNet持续成为一系列相关任务(如前景提取、图像抠图、人像分割)中最强的开源模型,并永久免费开源。未来,他们计划将BiRefNet扩展到更多任务,如伪装物体检测、显著性检测等,并进一步优化轻量级架构,使其在边缘设备上也能高效部署。


开源项目地址:https://github.com/ZhengPeng7/BiRefNet