
一 |

二 | IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。 IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。文书显示,上海幻电信息科技有限公司曾对某食品公司申请注册的的方便食品类“哔哩哔哩BILIBILI”商标申请无效宣告。

三 | 但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。 谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。国家知识产权局裁定认为,幻电公司请求认定引证商标为公众所熟知的商标的理由缺乏事实依据,裁定诉争商标予以维持。幻电公司提起政诉讼,请求法院撤销被诉裁定,并判令被告重新作出裁定。 GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。

四 | GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。

五 | 模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。 训练数据以合成为主。法院审理认为,幻电公司向国家知识产权局提交的基本信息等,与判断引证商标是否构成驰名商标并无关联;且证明B站及其手机客户端的知名度、宣传情况及推广情况,不足以证明引证商标在其核定使用的培训等服务上具有了较高的知名度;同时,幻电公司向国家知识产权局提交的B站内部“入站必刷”视频、播放量最高博主截图、B站运营游戏情况等,不足以证明引证商标在其核定使用的服务上构成驰名商标。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。最终,法院裁定驳回原告上海幻电信息科技有限公司的诉讼请求。

六 | 泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。 性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

七 | 参考。

八 |
Current article:http://www.liaoenxingunchuanglou.buzz/nmif3dv/jw9.pptx
Published on:16:16:09
宁波一员工参加公司年会领到彩票中608万被要求平分其他人,律师:既不合理也不合法
北京时间
《让美好发生》聚焦福彩公益:每一份善意都在发生
天地男儿
2026年上半年京津冀经济总量同比增长5.1%
下北阳光灿烂的日子