zh:lang="zh-CN"
1
1
https://www.panoramaaudiovisual.com/en/2018/04/27/proyectos-investigacion-seleccionados-idbit-audiovisual/

视听技术专业展展示了来自大学和商业领域的研究和开发项目,这些项目是由 R+D+BIT 计划选出的,这些项目开发的技术具有高附加值和增长潜力,适用于该行业。

我+D+位

为了宣传大学和商业领域的研究和开发项目,开发具有高附加值和增长潜力的技术,应用于视听行业,下一届 北理工视听,由 IFEMA 于 5 月 8 日至 10 日举办的专业视听技术展,展示了第二届 R+D+BIT 视听技术展。

评选委员会,由公司技术、创新和系统总监 Pere Vila 担任主席 RTVE, 重视大学、实体和公司提出的这些研究项目,因为它们对所开展的研究的机会做出了贡献;其对音像行业未来发展的影响能力;其应用潜力;你的方法、方法或目标的独创性;以及将不同感兴趣的参与者聚集在一起并进行协作的能力。

米格尔·德·塞万提斯欧洲大学 提出了 Voxel3d 项目,旨在为基于生成运动三维图像的交互式叙事奠定基础。该项目的目的是基于英特尔和微软等行业巨头的经验,开发系统,用录音和元素重组任何类型的场景,独立拍摄制作成分,然后将场景集成到虚拟环境中。

该项目将应用于视听制作和数字内容,特别是电影、电视、互联网和视频游戏。

另一方面,三个西班牙公司(头脑风暴, 先生工厂 y SDI)共同研究广播和影院环境中的超现实实时预览。

我们能够在 NAB 2018 展会(拉斯维加斯)的 Brainstorm 展台上首次看到该项目的首批应用,现在,在 BIT 视听展之际,SDI 将在其展台上进行演示。

该项目基于实时生成超现实场景的能力,作为 4K 和 8K 影院的预览以及 HDTV 和 4K 广播的最终结果。尽管色键技术和虚拟工作室已经存在很长时间了,但后者有时会因与其他非实时应用程序(例如合成和 VFX 技术)相比相对缺乏真实感而受到批评。然而,虚拟演播室需要实时技术,因此如果我们想提高场景的真实感和渲染的复杂性,对计算能力的要求就很重要。

在 NAB 2017 上,Brainstorm 提出了组合渲染引擎的提案,这是一种新技术,可以将 eStudio 渲染引擎(实时 3D 广播图形和虚拟工作室的基准)与 Epic Games 的虚幻引擎(一种先进的游戏渲染引擎,可实现出色的超现实图像质量)相结合。

MR Factory 开发了一种用于预览电影 VFX 镜头的工作流程,该工作流程使用 Brainstorm 的组合渲染引擎来保证进入后期制作之前镜头的质量。借助组合渲染引擎,可以使用 InfinitySet 作为 HDTV 甚至 4K 预览中心,通过保证不同镜头的调整(色度、摄像机移动、背景跟踪调整...),可以使用该技术大幅节省拍摄和后期制作成本。一旦在预览中调整完所有内容,InfinitySet 就能够导出摄像机数据、跟踪和设置运动,以 8K 分辨率进入后期制作,并保证所有质量。

诺基亚西班牙 参加本次 R&D+BIT 项目的目的是优化在互联网上分发的视频编码,特别是针对移动设备。他的研究旨在减少视频分发中使用的带宽,从而提高该业务的盈利能力。这些研究得到了与马德里理工大学合作进行的分辨率和视频质量对移动设备影响的分析的支持。

加泰罗尼亚理工大学(统一产品代码)和卡斯特尔德费尔斯电信与航空航天工程学院 (EETAC) 正在开展一个有趣的项目,为开放软件体系中的 TSN(时间敏感网络)网络开发 SDN(软件定义网络)控制器原型,并将其提供给开发人员社区,以便在未来改进和扩展它。这将使电视运营商(和其他行业)能够利用该代码,并将鼓励与视听行业相关的自由软件的创新和开发,正如 EBU 在其开源社区倡议中所鼓励的那样。

La tecnología SDI usada en producción de televisión (señal de video sin comprimir transportada sobre un circuito digital -cable coaxial o fibra-) será próximamente reemplazada por tecnología Ethernet/IP (conmutación de paquetes), y específicamente por los protocolos AVB/TSN (Audio/Video Bridging, Time Sensitive Networking) que el IEEE está estandarizando en el Working Group 802.1. Básicamente es una Ethernet síncrona basada en ranuras temporales y reloj PTP/IEEE 1588. Esto permitirá ahorros notables en el coste de instalación y operación de los equipos de producción de TV, así como un incremento en la flexibilidad de las operaciones. Otros grupos como el Joint Team on Networked Media (JT-NM) impulsado por EBU, SMPTE y VSF están desarrollando arquitecturas All-Ethernet&IP en la misma línea, e incluso prevén la virtualización completa de la producción de TV y la introducción de cloud computing . Aparte del caso de uso de producción de TV, TSN tiene también mucho futuro en áreas como industria 4.0, o buses de comunicación en vehículos/trenes/aviones.

另一方面,在IP网络领域,设备管理和控制领域正在经历重要的技术变革,从传统的分布式模型(路由器和交换机具有一定程度的智能并相互协作)转向软件定义网络(SDN)模型,其中设备的智能集中在控制器中,计算机成为执行控制器要求的“哑奴隶”。这使得控制器能够全面了解网络状态(设备、传输流量的分布、问题等),并且可以轻松执行在分布式架构中难以执行的优化(负载平衡、路由优化、镜像和流量保护)。

引入 SDN 来管理 AVB/TSN 网络将带来显着的改进,这就是 IEEE 已在正在开发的 802.1Qcc 标准中对其进行定义的原因。 802.1Qcc 基于 HTTP 和 YANG 数据模型上的 RESTconf 消息,定义了两个级别的控制器(CUC,集中用户配置)和 CNC(集中网络配置)以及它们与网络设备之间的接口。

超媒体实验室 卡洛斯三世大学 来自马德里的公司向本期 R+D+BIT 展示了 Azor 项目,该项目旨在实现通过无线技术捕获和编辑多机位视频的综合解决方案。尽管无线传输视频信号的技术取得了进步,但还没有允许通过无线连接同时捕获多个视频信号并允许同时编辑所有信号的解决方案。

Azor 被认为是一种新颖的便携式电视演播室,具有基于人工视觉和机器学习技术的先进功能。它由基于通过远程控制连接到多个摄像机的计算机程序的同步和多捕捉视频捕捉程序(最多同时连接8-10个摄像机)组成

该研究的主要机会之一是在不同联赛(意大利、德国……)和全球锦标赛(2016年和2017年世俱杯、U-20世界杯)中实施VAR(视频助理裁判)视频裁判系统。该系统在下一届俄罗斯世界杯上的使用,标志着该系统在足球裁判中得到了扎实的落地。

此外,该系统的到来也意味着裁判方面新的培训需求的出现,包括熟悉不同级别、不同代际的裁判从不同角度分析比赛情况。

Azor 系统构成了一个使用四个摄像头分析训练中比赛情况的工具(尽管该系统可以扩展并适应使用分布在训练场不同点的更多摄像头)。同样,该系统具有一系列有助于分析比赛的功能,例如标签系统,可以对视频中记录的比赛情况的特定片段进行延迟分析。按情况进行标记可以加快分析速度并提供统计信息。

最后,该系统允许从无线设备捕获视频,从而使系统安装简单快捷,无需布线,以免干扰裁判的动作。

此外,该系统还可用于记录需要多机位制作的事件(会议、研讨会...),但无需分配大量技术和个人资源来执行。

卡洛斯三世大学还提出了 GoAll-PervasiveSUB 项目,旨在为聋哑人提供无障碍服务。聋哑人被认为是世界上最严重的残疾之一,因为在交流方面要复杂得多,因此会产生孤立,这就是为什么使用该软件被认为是合适的。由于风险较高,这些人中的大多数人不会单独外出,这就是为什么他们中的大多数人需要口译员才能在日常生活中正常工作。还必须考虑到,由于他们看不到或听不到,他们的交流方式是通过触摸,社会不准备以有效和情感的方式与他们互动,这就是为什么它被认为是一种相关的方法。

这是一个全球范围内的开创性项目,其方法论侧重于技术研究和开发。该软件负责从电视频道中提取字幕,将其发送到中央服务器,然后再转发到智能手机或平板电脑。聋哑人唯一要做的就是将名为 GoAll 的应用程序连接到中央服务器并选择他们想要访问的链;这样,应用程序将负责将字幕发送到盲文线路。

考虑到这一人群不具备与健全人相同的阅读能力,系统已进行配置,使其可以更慢地传递字幕。还必须考虑到盲文行并不完全相同,因此解决方案是剪切字幕,以便根据行上可用的字符发送字幕。这项技术使患有这种残疾的人能够进行他们以前无法或需要帮助才能进行的活动,例如了解每日新闻。

据估计,西班牙聋盲人的数量在 7,000 至 100,000 人之间,这是一个非常多样化的群体,具有不同类型和程度的视力和听力损失,毫无疑问,他们将从此类举措中受益。

优吉特科技 参与 R+D+BIT 的 AutoFace(政治)项目,该项目监控各种电视频道,并以完全自动的方式发现出现的不同角色的名字,对他们的出现时间和表达的情绪进行统计。

该系统通过集成音频、视频和图像的多模态分析来实现。该视频用于提取关键图像,随后分析这些图像以检测图像中出现的人物面部和可能的图形文本。反过来,语音到文本转换系统也应用于音频。

随后,基于深度学习的面部识别算法应用于检测到的面部,将不同的个体分组为“簇”。另一个卷积神经网络也用于识别角色的情绪,对 7 种不同的情绪进行分类(中性、快乐、愤怒、悲伤、惊讶、恐惧、厌恶)。最后,应用人工智能技术,图形或对话中出现的角色名称必须与面部识别系统生成的集群相关联。

为此,Ugiat 设计了一个初步系统,可以捕获西班牙主要电视网络的不同新闻节目:RTVE、Antena 3、Telecinco、Cuatro、La Sexta、TV3;每秒分析一张图像并识别主要政治人物,获取他们出现时间的统计数据。该系统每月分析约 200 万张图像。
所有用于面部检测和识别、情绪检测、图形检测以及将字符与姓名联系起来的人工智能的深度学习算法都是由加泰罗尼亚理工大学的附属机构 Ugiat Technologies 开发的。语音到文本的转换是使用第三方软件完成的。

内容的自编目和元数据的自动提取在视听行业的不同领域变得越来越重要。在内容制作中,对原材料进行标注为更高效的编辑提供了很大的帮助。在推荐系统中,提取的视听元数据可用于改进系统的预测,目前系统的预测仅基于有关内容特征的文本信息。通过自动元数据分析,不仅可以检测演员,还可以检测产品、商标、颜色、动作、场景类型,这为获取用户档案提供了非常重要的大数据。此外,获得的元数据可用于丰富用户体验,与客户端交互以实现更有效的导航(重复短语、场景)或提供更多描述性内容(演员、歌曲、产品...)。

i2CAT基金会 共有三个项目参与本次R&D+BIT。一方面,它致力于ImmersiaTV的发展,该公司追求创建电视内容生产、分发和消费的新格式,以实现沉浸式和可定制的体验。其目标不仅是为多屏场景提供高效支持,而且实现传统内容与全方位内容(如360°视频和空间音频)之间的透明集成,从而打开新的精彩场景之门。该项目涵盖技术、创意和用户体验方面的研究。

该项目为整个端到端视听链带来好处,因为它提供了新的解决方案和工具,用于捕获、制作和编辑全方位内容(例如作为 Adob​​e Premiere Pro 插件)或将 360° 视频与图形内容和传统视频(通过门户或“覆盖”)相结合的场景,并具有适当的过渡和效果;以及用于沉浸式服务信令、与传统广播内容(例如 HbbTV)的链接以及通过宽带进行自适应分发(考虑到消费设备的异构性和 360° 视频感兴趣区域)及其同步播放的新解决方案。它还为全向内容的新消费平台打开了大门,该平台均基于Unity3D和Web组件,并支持多屏场景。

i2CAT 基金会参与的另一个项目是 ImAc(沉浸式无障碍),旨在保证沉浸式多媒体服务的可访问性,包括 360° 视频、空间音频和虚拟现实 (VR) 内容。这将提供充分的叙述、更多更好的信息获取和可用性,无论用户的感官和认知能力、年龄、语言以及其他困难或缺陷如何。提供的无障碍服务包括:隐藏式字幕、音频字幕、音频描述和带有手语翻译的视频,以及适当的用户界面和辅助技术。这个想法是,沉浸式和可访问性功能是自适应的,具体取决于用户的需求和/或偏好,以及它们如何与视听领域常用的技术和格式兼容。

i2CAT 基金会还向该 R&D+BIT 提交了 VR-Together 项目,其主要目标是实现虚拟现实 (VR) 体验,让沉浸在家庭环境中的常见虚拟环境中的远程用户之间以经济实惠的方式和逼真的质量进行自然的社交互动。

这一开创性项目包括使用最先进的软件技术和商业(低成本)硬件组件组装端到端平台。另一方面,该项目追求端到端平台不同阶段和流程中各种基本技术和创意方面的创新解决方案和优化,包括:捕获、编码、处理、分发和消费。它始终考虑现有技术和基础设施,提出更好的技术和/或向后兼容且符合标准的扩展。此外,该项目遵循一种方法论,其中用户是每个流程的主角(以用户为中心的方法论),无论他们是最终用户、专业人士还是感兴趣的代理人,以便准确地获得必要的需求并验证所获得的结果。

在一些国家,模拟电视的关闭或从第一代数字电视(DVB-T)到第二代数字电视(DVB-T2)的过渡正在或即将进行,因此多达三种类型的电视信号可以在无线电频谱的相同频段中共存。有时,在调整电视接收设施或监控广播网络的部署时,能够区分信号类型或其一些基本参数是很方便的。所以, 坡度加利西亚电信技术中心)开发了一个项目,考虑到许多测量设备都包含完整的接收器芯片,只是为了获得所需的有关电视信号类型及其基本参数的信息,这使得所述设备更加昂贵,并且不允许针对未来可能的变体或新的电视广播标准进行更新。

所提出的解决方案基于计算简单的算法,以软件或可重构逻辑执行,使用测量设备中已有的逻辑资源,增量成本非常低,并且可以适应电视广播标准的未来变化。

向 R+D+BIT 提交的、有更多公司参与的项目之一是 易电视 (方便欧洲残疾人接触融合媒体和内容)。他们在马德里理工大学 (UPM)、Engineering Ingegneria Informatica SPA(意大利 ENG)、希腊研究与技术中心(希腊 CERTH)、Mediavoice SRL(意大利 MV)、巴塞罗那自治大学(西班牙 UAB)、意大利聋人与残疾人联盟罗马省分会(意大利 UICI)以及西班牙全国聋人联合会消除沟通基金会开展研究工作障碍(FCNSE,西班牙)。

EasyTV项目的目的是促进感官障碍(听觉/视觉)人群获得信息社会和电信的一线产品和服务,使他们能够与其他人群同等水平地享受视听内容,避免边缘化以及现有信息获取不平等带来的问题。因此,该项目提出设计和实施一个平台,该平台提供一系列技术解决方案,可以提高高级字幕、创建自动音频叙述、干净音频、可配置手语视频、音频字幕或图像放大等方面的可访问性,从而打破现有的语言障碍。所有这一切都在定制环境中进行,系统可以适应每个用户的特定需求及其偏好。

从技术角度来看,该项目基于对可访问技术的最新水平的分析以及在 HBB4ALL、DTV4ALL、Cloud4ALL 或 Prosperity4All 等其他欧洲项目中获得的先验知识。该项目将提供创新服务,以改善对视听内容的访问,以提高用户体验,主要有两个方面:图像适应,使用各种创新算法提供基于内容的放大和强化;通过自动旁白增强内容描述并提高音频清晰度;以及通过众包平台和跨语言翻译打破手语障碍的创新技术。

所有这一切都发生在内容超个性化的环境中,用户会收到有关可用新服务的建议,并允许他们根据自己的需求调整不同的界面。在联网电视中使用新的 HbbTV 标准来传播与电视频道相关的应用程序,可以实现设备之间的互连,从而提供更好的信息访问。

最后,公司 作为一个愿景 他们与 5G-CROSSHAUL 项目的其他合作伙伴合作,提出了一项倡议,旨在改进对 IP 视频传输技术的评估。用户对检查网络状态的新的、更高效的算法的需求以及确保高影响力内容传输的基本质量要求的需求至关重要,特别是考虑到内容具有越来越苛刻的特性,包括更高分辨率(4K、8K)或丰富的格式,例如 HDR(高动态范围)和 HFR(高帧率)。

因此,在 5G 交叉传输项目中进行的开发之一包括视频质量分析探针,它允许以虚拟化方式连接到传输网络的任何节点以检查其状态并防止用户接收多媒体内容中的伪像和不良效果,因为警报的传输将允许立即重新配置网络节点,以便用户在最佳条件下接收内容,从而提高体验质量。

在所有这些项目中,有五个项目被选中在为期三天的展会期间在北京理工大学视听论坛(7号馆礼堂)的框架内进行展示。具体来说,它是电视制作中 TSN 网络的 SDN 控制器;苍鹰; GoAll-PervasiveSUB(聋盲人电视); EasyTV 和 Visiona 与 5G-CROSSHAUL 项目合作伙伴的倡议。

经过,2018 年 4 月 27 日,部分:商业, PA 特价 大型特色

其他文章有关

你喜欢这篇文章吗?

订阅我们的 通讯 你不会错过任何东西。