ECCV 2026举办MARS2 Workshop,用 3108 支广告视频考AI能否看懂营销意图
钛动科技在ECCV 2026牵头举办Agentic Commerce方向Workshop,配套挑战赛以 3108 支广告视频构建数据集,64 支团队提交超过 1060 份方案。赛道间最高分差距明显:视频整体理解 86.67 分,关键时刻定位 62.27 分,营销意图推理 63.53 分。
AI解读:这条新闻的核心不是“AI又拿了个高分”,而是同一批模型在三层任务上的分数断层。看懂广告讲了什么,最高 86.67 分;在长视频里找准关键时刻、拆解营销意图,最高只有 62.27 分和 63.53 分。承上启下的分水岭很明显:感知能力已经够用,跨片段推理还差一截。
对做多模态应用的人来说,一份消融实验比榜单更有参考价值。VTG赛道有团队给模型补了一条跨模态“音频证据时间线”,把定位精度提高 16.7 分;而同赛道把模型参数从 4B扩到 8B,分数反而掉了 0.2 分。在算力有限的前提下,先让模型把信息听全、看全、对齐,收益大于换更大模型。
比赛设了三项硬限制:MAC和MDC赛道模型不能超过 14B,VTG不能超过 8B,且只能用开源权重。这意味着成绩不能靠调用巨型闭源模型压出来,对开源模型和中小团队更有参照意义。相关评测基准与代码将向研究社区开放,赛道冠军方案在技术报告中有披露。
普通读者不需要立即为这条新闻做什么。真正相关的是做视频理解、广告投放和Agent工作流的团队:M-CAR数据集把 36.5 小时视频切成 18198 个语义片段,平均约 7 秒一段,可以直接用来检验自己的模型在时序定位和意图推理上的短板。不过需要注意,这项评测来自钛动科技自家平台与EvalAI的排名,样本集中在广告视频,结论不宜直接外推到其他视频任务。
9 月 8 日至 12 日,ECCV 2026在瑞典马尔默举行。这场由欧洲计算机视觉协会主办、Google、Meta、Apple、Amazon等公司赞助的会议上,一个名为MARS2的Workshop把议题设在了Agentic Commerce(智能体商业)方向。据ECCV官网公开信息,MARS2是本届ECCV全部Workshop中,唯一一个由中国科技公司牵头举办的Agentic Commerce方向Workshop,牵头方是钛动科技。
MARS2全称《Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond》(大模型时代的多模态推理与慢思考:迈向System 2及以上)。牛津大学教授Yarin Gal、MIT助理教授Paul Pu Liang、伦敦玛丽女王大学Shanxin Yuan、林雪平大学Fahad Shahbaz Khan在Workshop上做了分享。
M-CAR数据集:3108 支广告视频切成 18198 个语义片段
配套的MARS2多模态AI挑战赛(MARS2 2026 Challenge)设置三条赛道,共同使用名为M-CAR的数据集。据量子位报道,M-CAR基于钛动科技真实商业场景构建,包含 3108 支广告视频,覆盖 30 多种语言,总计 36.5 小时,被拆分为 18198 个语义片段,平均约 7 秒一个独立片段。
三条赛道对应三层能力:先看懂整条视频(MAC),再找到关键时刻(VTG),最后读懂背后的营销意图(MDC)。选手在本地让模型逐一答题,结果上传至EvalAI,由平台统一评分和排名。
三项冠军成绩:MAC 86.67分,VTG 62.27分,MDC 63.53分
挑战赛设有 10 万美元奖金池,吸引 64 支全球团队入场,累计提交超过 1060 份方案。据量子位报道,来自中国科学技术大学、南开大学、中山大学等高校的学者,以及字节跳动、京东、小红书等企业的代表参赛。
最终成绩:MAC赛道冠军为The Boys,86.67 分;VTG赛道冠军为Ya PTers,62.27 分;MDC赛道冠军又是The Boys,63.53 分。The Boys一支队伍拿下两个冠军和一个亚军。MAC与VTG、MDC之间的最高分差距超过 20 分。
参赛存在模型规模硬限制:MAC和MDC使用的模型不能超过 14B,VTG不能超过 8B,且只能使用开源权重。
消融实验:补音频时间线提高 16.7 分,参数从 4B扩到 8B反而 -0.2 分
据量子位报道,VTG赛道有团队为模型补上一条跨模态“音频证据时间线”,把人声、音乐和其他声音发生的时间标出来,再与画面逐一对齐,模型定位精度提高了 16.7 分。相比之下,参数量从 4B扩展到 8B反而 -0.2 分。
三个赛道的冠军方案用到Proposer-Critic双模型验证、从粗到细的两阶段定位,以及按视频时长灵活分配模型处理的视觉信息量。竞赛技术方案报告把这一思路概括为“证据链工程”。赛事设计、评测结果和优胜方案已整理成技术报告,相关评测基准与代码将向研究社区开放。
钛动科技的模型与商业数据
钛动科技称其自研多模态模型为钛极(Tec-Chi)。据量子位报道,今年 1 月,Tec-Chi-Think-1.0-32B以 85.82 分登顶广告营销专业大模型测评榜SuperCLUE-Mkt;约半年后,Tec-Chi-VL-1.0-27B在SuperCLUE-AdsVU出海营销视频理解测评中以 86.43 分位列总榜第二,与阿里巴巴千问Qwen3.7-Max-20260608共同位列亚军。
钛动科技于WAIC 2026期间发布营销多智能体平台Navos。据量子位报道,今年 7 月,钛动科技成为ChatGPT Ads全球首批官方技术合作伙伴;在ChatGPT Ads首批广告主定向邀请测试中,某出海品牌经钛动AI技术团队优化,营销成本下降,ROI提升到原来的 2.5 倍。
钛动招股书显示,2025 年前三季度,AI营销解决方案收入 1.16 亿美元,同比增长 68.5%,占公司总收入的 89.5%,同期净收入留存率 132.5%;公司营收约 1.30 亿美元,同比增长 74.5%,净利润 5568 万美元。钛动称已连续三年保持超过 82% 的毛利率,账上现金储备超过 4.4 亿美元。
技术公司牵头顶会Workshop的既有做法
据量子位报道,CVPR 2025的Embodied AI Workshop组织者名单中出现NVIDIA、Meta、Apple、Microsoft、Adobe、Amazon等公司;同年自动驾驶Workshop继续举办Waymo Open Dataset Challenge。报道将钛动牵头MARS2归入同一类做法。
钛动科技CTO Tracy Chen表示,MARS2 Workshop的举办验证了一个判断——AI Agent正在从概念走向真实商业场景,营销是少数既需要复杂智能、又能快速验证效果的领域之一。钛动科技品牌公关VP张羽雪在闭幕致辞中称,MARS2 Workshop的讨论展现了前沿技术如何解决真实商业难题,这是钛动在国际学术会议组织讨论、举办挑战赛的目的。