YOLOMM 图图多模态目标检测 图文多模态 · yolovo.cn

mmyolo.cn

2025-YOLO|RTDETR多模态目标检测项目

RGB 结合红外 / 深度等对齐模态,YOLO 与 RT-DETR 共用一套多模态框架。

2025-YOLO|RTDETR多模态目标检测项目

对于当今的视觉任务来说,最简单入手的便是YOLO系列,通过ultralytics库的帮助下,无论是否来自计算机科班的同学基本都可以快速构建自己的目标检测模型。但是与简单方便相伴而来的是现在的YOLO系列模型的整体拒稿率越来越高,甚至与很多期刊或导师看到YOLO四个字便直接Reject,即使组合出性能优异的检测模型也难以发表到心仪的期刊上去,因此单靠单模态的YOLO发有点要求的期刊已经开始显得有些吃力。很多人尝试转向RT-DETR模型,对于从YOLO迁移过去的人来说一样简单好用,但是RTDETR的训练成本要比YOLO系列模型略高,因此对于部分没有服务器/自费服务器的同学来说可能有点难接受。虽然单模态的YOLO确实显得吃力,但是多模态的YOLO就不是这样了,从去年开始多模态就开始慢慢火起来,但由于缺乏相对应的教程,让很多人望而止步,从去年到今年,也越来越多人问,有没有多模态相关的YOLO改进项目?别急,它终于要来了,而且还不止YOLO,RTDETR的多模态也有!

1. 这个项目包含什么内容?

  1. 这个项目主体思路是在尽可能的保证继承ultralytics库简单好用的基础上为YOLO与RT-DETR现阶段这两个最热门的目标检测器,提供出多模态的能力。《可以理解为YOLO|RTDETR的多模态进阶版》
  2. 这个项目的核心是在原有可见光(RGB图像的基础上)结合红外或深度图谱(以及其他对齐后的图张量数据)实现多模态信息结合的能力。
  3. 同时根据自身的工作经验,我们在项目中提供大量不同的多模态模型结构基础模型进行对应的实验选择。
  4. 在项目中我提供了灵活自由的模型配置方式《本项目基于Ultralytics的YOLO以及 RTDETR 模型进行对应的修改》通过使用不同的模型 yaml配置方式实现调用不同的模型配置结构,同时拥有几百个改进点的改进项目结合多模态直接起飞~
  5. YOLOMM 模型考虑支持目标检测,实例分割,旋转目标检测。姿态检测,分类。RTDETRMM 模型仅支持目标检测
  6. 项目内容提供深度模态,DEM,Edge模态的生成。不提供红外模态的生成
  7. 本项目不提供非对齐多模态图像的支持,不提供模态配准的内容。
  8. 本项目主要以代码+答疑群形式展开,教程稀少属于进阶项目但是有 YOLO 基础就可以上手,想要灌水或者发表高质量文章的都可以考虑本项目。
  9. 提供YOLOMM 和 RTDETRMM 的多模态蒸馏和剪枝(全网独一份)方法
  10. 项目内仅提供 M3FD RGBT-Tiny drone_vehicle这三个数据集作为参考示范

2. 这个项目会以什么形式开展?

  1. 本次项目核心目的在于为大开箱即用的完善的图图多模态目标检测项目,由于架构设计的内容如果魔导的其他Ultralytics项目内的改进点也可以迁移到多模态项目中(例如v8v10、v11v12、rtdetr改进项目中)。但需自行掌握迁移方法。
  2. 项目内我将提供多种不同形式,融合思路的模型配置,大家可以在其中选择一个进行改进创建。同时未来也会在项目中提供一些模块方便大家组合实验。
  3. 这个项目会以未来持续更新的态势进行扩展,包括支持更多多模态基础模型以及不同的实验功能,还有专属于多模态项目以及通用的改进模块。考虑到工作与时间上的问题这会是一个持续更新的过程,大家也不用着急。
  4. 附带答疑群,群里主要是答疑实验,代码操作,代码报错等问题。考虑到个人空闲时间问题不一定每一个问题都能及时回答,也可以在群里询问其他大佬的帮助。一些反复出现的高频问题也会收集录制对应的答疑视频来给大家解答。我本人也会在群里给一些多模态写作投稿的思路与建议。

3. 入手须知

  1. 本项目毕竟是为YOLO以及RT-DETR系列做的扩展,因此建议在已经有了ultralytics库的使用经验后来使用本项目。同时为了达到最佳效果,强烈建议搭配魔导的相关改进项目来配合使用。 以下人群非常不建议入手此项目:
  1. 此项目不涉及多模态数据中的配准相关问题。
  2. 考虑提供生成模态的办法作为数据集来源缺失的补充。(生成模态办法主要以深度方面,采用成熟深度学习代码包括一些顶会的工作进行相关模态生成。由于生成模态的作用因此可以在单一模态数据集上进行额外扩展,实现一集多用的办法同时避免配准的问题。)
  3. 本项目仅包含图像相关的多模态,不包含图像+文字的多模态。
  4. 本项目的环境建议在torch2.0以上版本跑。有一些专门的优化API调用。模型显存占用体积会比单模态较大,但是不用担心,速度不会降低很多,依然是快速的训练。(目前测试YOLOMM 可以在 3060 8G 显卡下跑)
  5. 本项目无传统 YOLO 概念的 baseline 形式,而是通过提供基础型号配置+改进的方式进行实验。

4. 价格

  1. 本项目价格为328,购买过《YOLOV8V10改进项目》、《YOLO1112改进项目》、《RTDETR改进项目》、《ultralytics-26项目》其中之一的优惠50,优惠后价格为278。不叠加仅限本人使用。
  2. 虚拟项目一经售出不退不换,需要入手前考虑清楚,如果你是初次入手我的项目,怕我不靠谱,可以先考虑入手个YOLO和RTDETR看下。
  3. 如果确定需要购买的话,请把以下的内容原封不动复制给汤圆,
    确定2购买5多模态3项目

5. 项目使用问题

  1. 购买本项目的使用者都会得到一个独一无二的用于解压7z的密码,到时候用于解压对应的压缩包,此密码自己妥善保管,请勿告诉他人。
  2. 本项目的视频(本项目视频极少非传统教学项目)统一都是加密视频,每个购买者都可以得到一个激活码,激活码在每个人专属的7z压缩文件内。

6. 项目闲谈

  1. 2026 年三月利用本项目新发表一篇计算机 SCIQ2,一篇 CCFC

7. 更新日志

2026年6月

2026年5月

2026年3月

2026年2月

2026年1月

2025年12月

2025年11月

2025年10月

2025年9月

2025年8月

2025年7月