YOLO 系列的事实标准实现,检测、分割、姿态与跟踪一站式。
👁️ 计算机视觉
目标检测、分割、多模态视觉语言模型
Meta 的“分割一切”模型,提示式图像分割基础模型。
开源计算机视觉库,行业标准。
可复用的计算机视觉工具集,处理检测结果、标注与跟踪。
Google 的跨平台端侧机器学习解决方案。
PyTorch 图像模型库,预训练视觉骨干的集大成者。
Meta 的目标检测与分割平台。
OpenAI 的图文对比学习模型。
OpenMMLab 的目标检测工具箱。
2D/3D 人脸分析工具包,识别与检测。
A simple screen parsing tool towards pure vision based GUI agent
视觉指令微调的多模态大模型,开启 GPT-4V 级开源探索。
通义千问视觉语言模型,擅长文档、图表与视频理解。
Segment Anything 第二代,支持图像与视频分割。
[ECCV 2026 Best Paper Award Candidate] LingBot-Map: Geometric Context Transformer for Streaming 3D Reconstruction
CLIP 的开源实现,含大量预训练权重。
Meta 的自监督视觉特征学习,通用视觉表示。
NVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.
🐍 Geometric Computer Vision Library for Spatial AI
用文本描述检测任意物体的开集目标检测。
上海 AI 实验室的开源多模态大模型家族。
tiny vision language model
PyTorch3D is FAIR's library of reusable components for deep learning with 3D data
OpenVLA: An open-source vision-language-action model for robotic manipulation.