2025 年 8 月,Meta AI 研究机构 FAIR 发布自监督视觉基础模型 DINOv3,并开源官方 PyTorch 实现(GitHub 仓库 facebookresearch/dinov3,目前约 1.13 万 star)。它的定位可以一句话说清:这是「给 AI 当眼睛」的通用底座模型——先用海量图片自学出通用的视觉理解能力,之后接上不同的「任务头」,就能做图像分类、目标检测、语义分割、深度估计等具体工作,多数场景只需少量标注数据微调即可。它适合三类人:做计算机视觉(CV)的工程师、算法研究者,以及想给应用加上图片理解能力、但手里没有大量标注数据的团队。
自监督:一种不用人工标注的学习方式
传统视觉模型训练依赖大规模人工标注:想让它认识猫,得先给几百万张图片一张张标上「猫」。标注成本高、扩展慢。
「自监督」绕开了这个瓶颈:模型自己从图片结构里找规律,典型做法是遮住图片的一部分、让模型根据剩余部分猜回被遮住的内容,猜得越准说明理解越深。这类方法不需要标注,图片本身取之不尽,所以能用远超人工标注规模的数据来训练。DINO(第一代,2021 年)和 DINOv2(2023 年)已证明这条路走得通,DINOv3 是这一系列的第三代,也延续了「自监督」的名字(DINO 是英文 Self-Distillation with No Labels 的缩写,即「无标签自蒸馏」)。
两条模型线:从 2100 万到 67 亿参数
DINOv3 不是单个模型,而是一个模型家族,包含两种架构:
- ViT 系列:ViT(Vision Transformer,视觉 Transformer)的核心思路是把图片切成固定大小的小块,像处理文字序列一样交给 Transformer 网络(一种擅长捕捉长距离关联的神经网络结构)处理。提供 S/16(2100 万参数)、S+/16(2900 万)、B/16(8600 万)、L/16(3 亿)、H+/16(8.4 亿)和 **ViT-7B/16(67.16 亿参数,即 67 亿)**共 6 档。
- ConvNeXt 系列:经典卷积网络(CNN)的现代化版本,提供 Tiny(2900 万)、Small(5000 万)、Base(8900 万)、Large(1.98 亿)4 档。
从几千万到几十亿参数,覆盖「笔记本上能跑」到「多卡集群才带得动」的完整梯度,各取所需。
训练数据:16.89 亿张网页图加 4.93 亿张卫星图
两套预训练数据集:
- LVD-1689M:约 16.89 亿张网页图片,覆盖日常可见的绝大多数视觉场景,通用场景首选;
- SAT-493M:约 4.93 亿张卫星遥感影像,面向地理空间应用(如土地利用分类、植被监测)。
同一型号会有「网页版」和「卫星版」两套权重,比如 ViT-L/16 和 ViT-7B/16 都同时提供两种预训练版本,按任务选即可。
能干什么:分类、深度估计、检测、分割、零样本
官方随仓库发布了多套「预训练头」(在底座模型之上加的小型专用模块),开箱即用:
- 图像分类:基于 ImageNet 数据集训练的分类头(目前提供 ViT-7B 版);
- 深度估计:Depther 模型,能从单张图片估算每个像素离镜头多远,训练于 SYNTHMIX 数据集,在 NYUv2 基准上评测;
- 目标检测:基于 COCO2017 数据集训练的检测头;
- 语义分割:把图片按语义区域划分(如天空、道路、行人),基于 ADE20K 数据集、配 M2F 解码头(Mask2Former,一种主流分割模型);
- 零样本分割(dino.txt):不预先指定类别也能分割,借助文本对齐方法 DINOv2 Meets Text 实现,「零样本」指模型没专门学过这些类别也能处理。
生态与上手:三条路都能跑
DINOv3 已进入主流生态:Hugging Face Transformers(最流行的开源模型加载与使用库)从 4.56.0 版(2025 年 8 月)起官方支持,timm(PyTorch 图像模型库)从 1.0.20 版(2025 年 9 月)起支持,同时可通过 torch.hub 加载。无论你习惯用 Transformers 的 pipeline(几行代码提取图像特征)、timm 的模型工厂,还是 torch.hub 直连官方权重,都有现成入口。仓库还附带 5 本可在线运行的 Jupyter Notebook,覆盖特征可视化、前景分割、稠密匹配、视频分割跟踪等入门场景。
一个实际使用细节:权重采用申请制——在 Meta 官网提交申请、邮件获批后会收到权重 URL 列表,用 wget 下载(官方明确建议不要用浏览器直接下载)。
训练成本参考
若想自己从头预训练:官方给出的参考是 ViT-L/16 在 4 个 H100 节点(共 32 张 GPU)上约 14 小时完成,训练出的模型在 ImageNet 上 k-NN 评估(最近邻检索:直接把测试图与训练库里最相似的样本比对归类)达 82.0%、线性评估(在提取的特征上训练一个简单线性分类器)达 83.5%。作为参照,最大的 ViT-7B 预训练需要 32 个节点、256 张 GPU,训练分三个阶段进行——这是大厂级别的算力投入,普通团队更多是直接取用官方权重。
后续动作与生态验证
发布后 DINOv3 持续有官方派生成果:2026 年 3 月推出基于 DINOv3 的 CHMv2 冠层高度图模型(用卫星图反演森林树木高度,可服务碳汇估算、林业监测),2026 年 6 月发布元数据引导训练(FINO)代码与论文。下游生态的持续产出,从侧面说明了底座模型本身的可用性。
结论:DINOv3 是 Meta 开源的第三代自监督视觉底座模型,用 16.89 亿张网页图或 4.93 亿张卫星图自学通用视觉能力,覆盖 2100 万到 67 亿参数的完整模型矩阵,接上任务头即可做分类、检测、分割、深度估计,并已被 Hugging Face 与 timm 官方支持——想在图像任务上快速起步又缺标注数据的团队,可以直接拿它的权重开跑。