新闻频道>新政风向

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

来源: 新华社
15:09:08

火影忍者

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

镜子超人

一 |     IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。         IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。    8月26日消息,日前,黑客组织CyberLeek(民间俗称“大葱哥”)泄露大量《GTA6》实机画面及开发素材,其中包含不少尚未公开的游戏内容,引发玩家广泛关注。         但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。    今日,Rockstar Games就此次泄露事件发表官方声明,并确认相关泄露内容属实。         谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。         GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。    R星表示,《GTA6》的实机画面以这样的方式提前泄露,让整个开发团队感到非常难过。

二 |          GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。    

    经过这么长时间的等待,这显然不是团队希望玩家第一次看到游戏的方式。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。

三 |          训练数据以合成为主。

四 |     R星同时向玩家致歉,称《GTA6》的开发和信息公布都花费了比预期更长的时间,包括游戏本身的制作、更多细节的公开以及官方实机演示等。

五 | 论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。     不过,R星也透露,目前《GTA6》的开发已经接近完成。

六 |          泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。    按照官方计划,《GTA6》加长版展示将于明日正式公布。

七 | 论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。         性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。    R星表示,为了准备这段内容,团队投入的时间比原计划更长,但希望最终呈现的内容能够达到甚至超出玩家预期。

八 |     对于此次泄露带来的影响,R星坦言,部分游戏内容被提前曝光后,难免会对玩家正式游玩时的体验造成一定剧透。    不过,官方仍希望玩家能够继续耐心等待,等到11月19日游戏正式上线后,再亲自体验完整内容。     R星最后感谢了过去一周向开发团队表达支持的玩家,并表示,《GTA6》始终是为玩家而做,未来还会继续分享更多消息。         参考。    

    

         

     【本文结束】如需转载请务必注明出处:      责任编辑:拾柒     文章内容举报     

Current article:http://8ib3w.jiubengtaibingpengou.pics/news/20260826_7852.html

Published on:07:15:23


关键词:3c认证,名人面对面,永不磨灭的番号责任编辑:密龙顺董