2020, une année d’Intelligence Artificielle chez RTVE Innovation
L’intelligence artificielle a été l’une des technologies phares de 2020, avec le cloud ou la 5G, et promet de continuer à l’être dans les années à venir. C’est ce que semblent indiquer les politiques, stratégies et investissements internationaux, européens et nationaux. L’arrivée de la pandémie et ses répercussions ultérieures ont démontré l’utilité de l’IA dans la recherche sur les virus et dans la recherche d’un vaccin, dans la gestion de grandes bases de données et d’ensembles de données de tout type ou dans la notification d’alertes. Malgré les difficultés économiques, les mouvements importants des marchés boursiers mondiaux ont dopé les entreprises qui s'y consacrent. Son utilisation dans les médias, comme dans tant d’autres domaines, devient chaque jour plus courante et ses applications plus spécifiques. Pour RTVE, comprendre ses possibilités, découvrir de nouveaux usages et être préparé technologiquement pour continuer à remplir notre vocation et notre mandat de service public à l'avenir est l'une des priorités de travail d'innovation de la RTVE.
L'utilisation de algorithmes dans les médias n’est pas aussi récent qu’il y paraît. Les premières expériences datent désormais de plus de 10 ans et ont été l'œuvre d'Américains, comme l'outil « Automated Insights » conçu en 2013 par l'agence de presse Presse associée pour créer des histoires à partir de données structurées telles que des données économiques, boursières, météorologiques ou sportives. Après lui sont venus des noms comme « Bertie » de Forbes, « Editeur » du New York Times, “Cyborg” de Bloomberg ou « Héliographe » du Washington Post, lauréat d’un prix pour « son excellence dans l’utilisation des robots », pour n’en citer que quelques-uns. On retrouve également de plus en plus de départements spécifiques allant des grands médias à ceux qui sont nés et ont grandi grâce à ces technologies. En Europe, les activités de la société britannique sont notables BBC, le finlandais YLE ou le belge VRT, tous publics et membres du UER, comme RTVE.
Les tests, cas et applications ont connu ces dernières années une croissance et une expansion exponentielle qui a pour référence technologique maximale, en raison de son impact frappant, le présentateurs virtuels télévision. Il peut s’agir de « clones » de personnes réelles ou de personnages créés de toutes pièces.
Bonjour Intelligence artificielle (IA), algorithmes, deep learning… sont courants dans la gestion et la synthèse de grandes bases de données ; dans la génération de textes et de graphiques ; dans les outils personnalisation o recommandation du contenu et de l'étude du publics; dans la révision et la recommandation de textes ; dans le lancement d'alertes ; en traductions, transcriptions et étiquetage automatique ; travailler avec des assistants vocaux ou appareils portables; favorisant le accessibilité avec des fonctions telles que la lecture automatique des informations avec des voix « synthétiques » ; segmenter les contenus télévisuels et radiophoniques en vue d'une rediffusion ultérieure, d'une diffusion numérique ou d'un archivage ; dans une tâche aussi fondamentale pour nous que la lutte contre désinformation; améliorer l'utilisation et l'accès aux fichiers ou nous libérer des tâches routinières qui donnent plus de temps et de ressources à la création de notre propre contenu de meilleure qualité. qualité, pour ne citer que quelques possibilités issues d'un catalogue en constante évolution.
Droit elles sont également nombreuses et croissantes, et pas seulement celles purement technologiques. Il va falloir répondre à son utilisation éthique et déontologique. Pour la meilleure utilisation possible de espagnol. À sa meilleure application en tant qu'outils qui ils complètent et non qu'ils détruisent ou réduisent la qualité du contenu. En décidant qui sera responsable de vos actions et décisions. Définir le propriétaire des éventuels droits d'auteur générés par votre activité. Pour son impact social positif et ne générant ni n’augmentant lacunes tels que la technologie ou l'accès à connaissance. Faire de cette technologie, comme une autre, un levier ou un moteur d’innovation, d’entrepreneuriat et transformation entreprise. Pour une utilisation responsable des données des utilisateurs dans des environnements « sûrs et fiables » qui garantissent les droits fondamentaux individuels et la « souveraineté numérique ». Pour définir votre transparence. Pour garantir sa robustesse face aux cyberattaques. Pour assurer l'absence de préjugés. Pour être cohérent avec son impact environnemental (ce qu’il a, et remarquable)…
L'intelligence artificielle à la RTVE
Comme c'est le cas pour d'autres médias de sa taille, de son histoire et de son caractère public, RTVE a décidé depuis des années que l'intelligence artificielle est l'un de ses principaux domaines de travail en matière d'innovation.. Bien qu'il existe actuellement des outils présents dans les activités habituelles de différents domaines de l'entreprise, comme l'information ou le numérique avec des alertes ou ceux dédiés aux publics et aux utilisateurs, entre autres, on les retrouve également directement dans la plupart des téléphones portables que nous utilisons, dans nos véhicules, nos assistants domestiques, nos montres intelligentes, etc., sans que nous soyons très conscients de sa quantité et de la manière dont elle est présente dans nos vies et nos activités quotidiennes.
L'objectif affiché, comme référence pour fonction publique et l'innovation, c'est enquêter et plongez dans les différents possibilités que l'utilisation de technologies basées ou liées à l'IA peut nous apporter.
Dans le domaine journalistique, l’IA permet de couvrir ce que nous ne pouvons pas atteindre en raison de sa taille (ligues sportives mineures) ou de sa complexité géographique (fournir de plus en plus d’informations locales), des sujets qui ont le même droit d’être traités et rapportés que d’autres sujets.
En 2020 dernier, pour explorer ce domaine, un projet pilote de tests avec EFE oui Narratif pour l'éditorial automatique de textes basés sur des sources de données structurées, telles que les résultats sportifs. L'expérience se réalise avec du contenu qui n'est actuellement pas traité par nos rédacteurs, en l'occurrence le 2ème B de la Ligue de Football et les catégories féminines. Il a été prévu, selon un workflow, que le contenu généré (adapté à notre livre de style) passe par le surveillance d'un journaliste avant sa diffusion, même si, une fois formé, l'algorithme peut le publier directement peu après la fin des réunions, y compris le texte et infographie.
En 2020, année compliquée en raison des perturbations provoquées par la pandémie dans pratiquement toutes les compétitions sportives, Narrativa a généré automatiquement près de 80 000 reportages sur le football, comprenant un aperçu de chaque match et un résumé avec les moments forts de chaque match.
À la fin de l'année, un nouveau fichier d'écriture automatique de texte a été publié, en l'occurrence pour le informations sur les résultats des élections futures dans des populations de moins de quelques milliers d’habitants. Les médias aiment BBC, YLE o Télévision française ils l'ont déjà expérience réel dans ce type de couverture électorale, tout comme le journal français Le Monde, qui a produit des dizaines de milliers d’articles en quelques heures grâce à l’IA « Syllabs » lors des dernières élections législatives françaises.
Un autre dossier important et remarquable par son importance est celui lancé avec notre Bas Documentaire pour lui métadonnées automatique 11 000 heures de vidéo Actualités et programmes des archives RTVE. Nous travaillerons sur du matériel déjà numérisé mais sur lequel il existe peu d'informations, soit en raison de son origine, soit de son ancienneté. Les technologies seront utilisées Parle (transcription, identification du locuteur ou segmentation du locuteur), Traitement du langage naturel (PLN. Identifier les entités) et le vision artificielle. Cette dernière ne durera qu'un nombre d'heures limité car il s'agit d'une technologie moins mature mais elle permet de se familiariser avec son utilisation, d'évaluer ses performances ou de trouver des applications possibles en raison de son grand potentiel.
Nous avons de nombreux tournages intéressants enregistrés sans audio et archivés avec des données limitées qui, sur la base de cette expérience, pourraient être plus utiles car plus faciles d'accès. récupération et réutilisation grâce à des métadonnées plus complètes et plus précises obtenues en beaucoup moins de temps et avec moins de ressources. L'une des propriétés du projet est son attractivité d'un point de vue technologique. Nous travaillerons avec des tiers, avec l'IA, dans le cloud,... avec l'idée de ne pas avoir de liens ou de dépendance technologique avec les grandes plateformes qui fournissent les services et de toujours rechercher le meilleur fournisseur pour chaque besoin.
Certains des principaux défis de ce projet sont comment intégrer ces données dans notre modèle d'archivage actuel, comment indice un énorme volume de métadonnées pour qu'il soit possible de les rechercher et de les visualiser ou le contrôle de la qualité des données, un domaine dans lequel une expérience très positive a été réalisée à travers les différents RTVE Défi IberSpeech.
L'IA comme lien
Un domaine dans lequel il y a une activité intense est celui de l'établissement, du maintien et de la promotion du rapports avec des entreprises technologiques, des entrepreneurs, des institutions ou des universités, avec lesquels, par exemple, il existe des outils de travail conjoints comme les différentes chaires établies avec certaines des principales de notre pays.
Avec le Université Carlos III de Madrid, avec laquelle nous collaborons déjà régulièrement avec d'autres entreprises spécialisées dans le sous-titrage automatique des informations de nos centres territoriaux, tant en espagnol que dans les autres langues officielles de l'État, fait l'objet d'une enquête dans le analyse des réseaux sociaux et son application à enrichir, ajuster o personnaliser des textes ou des nouvelles.
L'étude de cas s'applique à l'actualité sportive générée par l'IA, à laquelle nous souhaitons donner plus de contenu en ajoutant des informations pertinentes et pouvant être obtenues à partir de sources connues, comme les comptes des clubs de football, des joueurs ou des présidents des différentes équipes. Prendre des mesures comme celle-ci peut nous permettre, sur une actualité de base - comme un téléscripteur -, de proposer davantage contenu, plus précisément, toucher une audience plus large dans plus de lieux et d'appareils, gagner en personnalisation, un meilleur positionnement SEO, ou même être réalisé dans différentes langues.
Le automation d'une partie du travail de documentation des contenus audiovisuels et sonores de la RTVE, tant dans la phase de production que dans l'archivage définitif des collections documentaires, est l'objectif principal de la chaire avec le Université de Saragosse. Dans cette analyse des contenus audiovisuels, ou dans la manière dont Mégadonnées, le transcription au texte des enregistrements; il reconnaissance des haut-parleurs, des visages, des bâtiments et logos emblématiques et leur emplacement dans un timecode moyen ; le description automatique d'images, de plans et de séquences ou la création automatique de résumés, tant pour la radio que pour la télévision, entre autres activités.
Pour promouvoir le enquête Dans ces domaines, la Chaire a organisé, pour la deuxième fois depuis sa création en 2017, une défi para la comunidad científica, empresas y universidades implicadas en el sector, el Albayzín-RTVE, que en este 2021 se celebrará del 24 al 26 de marzo coincidiendo con el IberSpeech 2020. En este congreso internacional se presentarán los resultados del reto, pero ya se puede adelantar que han superado la expectativas y resultados de las ediciones anteriores, con tasas de acierto de hasta cuatro puntos más altas en los programas que presentaban mayores dificultades.
Il Observatoire de l'innovation dans l'information dans la société numérique (OI2), una iniciativa dedicada a la enquête en el que junto a RTVE participa la Universidad Autónoma de Barcelona, también dentro de una cátedra, ha dedicado gran parte de sus esfuerzos al estudio y difusión, en distintos formatos de conferencias o publicaciones y trabajos de investigación, del impacto de la IA en los medios de comunicación. Los temas tratados en estos últimos meses han sido los sistemas de prealerta, de redacción automática de textos, le personnalisation de contenidos, la lucha contra la désinformation et le fausses nouvelles oh vas-y presentadores virtuales, en la que está prevista una posible prueba con Alexa.
Colaboraciones internacionales
A los habituales contactos con empresas tecnológicas o la actividad regular en este campo que se mantiene con UER, la principal alliance mundial de medios de comunicación de servicio público, en este 2020 hemos participado por primera vez en el JournalismAI Collab organizado por Polis, el think-tank de periodismo de la London School of Economics and Political Science. En esta iniciativa mundial, en la que se han dado cita decenas de medios de distintos países, tamaños o canales de emisión, se ha trabajado durante los seis últimos meses del año en equipos multidisciplinares de periodistas, ingenieros o técnicos, explorando soluciones basadas en IA que nos ayuden en nuestra actividad. El trabajo, los resultados y las lecciones aprendidas por los equipos en este experimento de colaboración con la IA se presentaron en diciembre en el JournalismAI Festival.
RTVE ha participado en el grupo de “evergreen content", en el que el reto era cómo sacar más partido al material de archivo para actualizar o generar nuevos contenidos de temas que, no siendo de actualidad, tengan mucha demanda.
El resultado de nuestro trabajo fue un catálogo de soluciones para los medios de comunicación que quieren aprovechar el contenido de sus archivos y una herramienta “imaginaria”: “ArcAI”. Es un robot inteligente que revisa los archivos para recomendar las mejores coincidencias cada vez que un periodista empieza a trabajar sobre un nuevo artículo o tema. El motor de sugerencias de “ArcAI” tiene tres objetivos: reutilizar, inspirar y vincular. Basado en Procesamiento del Lenguaje Natural (NLP) y otras tecnologías relacionadas, “ArcAI” asigna una puntuación a cada contenido del archivo para encontrar posibles coincidencias.
También se realizó un llamamiento a las empresas tecnológicas para que trabajen conjuntamente con las redacciones desarrollando las herramientas que más se necesitan y que, realmente, podrían mejorar las capacités de los periodistas. Una experiencia similar es la presentada por el BBC News Labs, que ha desarrollado varias herramientas que utilizan los artículos de texto existentes como base para la creación de nuevos formatos para la narración digital de noticias.
El trabajo de otros grupos, centrado en explorar cómo la IA podría ayudar a dar soluciones a los retos que seleccionaron, se dedicó a pensar en herramientas capaces de resumir grandes conjuntos de datos o documentos y cómo hacer que estos resultados puedan mejorar el tráfico, la personalización o el acceso a nuestros contenidos; cómo se podría aprovechar la IA para entender, identificar y mitigar los préjugés o para mejorar la diversidad et le inclusión utilizando los algoritmos como una fuerza “positiva“; cómo entender y mejorar la retención de usuarios usando la IA y el ML y que contó con el ejemplo del South China Morning Post, que emplea el aprendizaje automático a través de una plataforma de datos de clientes, encuestas, concursos y sondeos; o para qué y por qué usar la IA y la automatización en el periodismo.
Tampoco faltó el debate y el encuentro con especialistas para tratar cuestiones como cuál será la relación o qué supondrá la IA en el avenir del periodismo, las principales tendances para los próximos años, cómo se están adaptando los medios o cómo evolucionará la interacción entre los periodistas y los algoritmos, la formación, las estrategias, las oportunidades o la responsabilidad que supone el uso de la IA, entre otras. En 2021 esperamos seguir avanzado y colaborando en una nueva edición del Collab.
Otra iniciativa europea que cuenta con IA y nuestra contribución es Europeana Subtitled, un proyecto en el que participa el Fonds documentaire junto a otras instituciones de referencia del sector, y que supone la publicación en Europeana (la biblioteca digital europea), de contenidos audiovisuales a través del EUscreen. Este proyecto supondrá la publicación de material del archivo de RTVE de manera enriquecida con subtitulado en distintos idiomas. El objetivo del proyecto es la generación y traducción automática de estos subtítulos a las distintas lenguas oficiales europeas. De esta manera se dará mayor visibilidad internacional a una selección de contenidos del archivo de RTVE sobre España y Europa.
IA durante la pandemia
La IA ha sido y es una herramienta clave en la lucha contra el coronavirus. Desde su detección y posterior alarma lanzada por la empresa canadiense BlueDot, que descubrió al virus como una “neumonía desconocida” gracias a su algoritmo, son múltiples los ejemplos y el empleo que ha tenido en todo el mundo en la búsqueda de vacunas y tratamientos, en la detección de síntomas o posibles casos positivos, en predicciones de expansión y propagación o comportamiento en lugares cerrados, en alertas, diagnósticos, en las apps desarrolladas por gobiernos, instituciones o empresas privadas, en la gestión de recursos o de enormes bases de datos, entre otros. RTVE, junto a EFE y Narrativa, ha participado en dos proyectos sin ánimo de lucro que han utilizado los datos y las cualidades de los algoritmos en la lucha contra el coronavirus:
Covid-19 Tracking Project está poniendo en abierto, desde el comienzo de la pandemia y sus devastadores efectos, la mayor base de narrativas automáticas generadas con IA, datos, informes, gráficas e imágenes de la évolution y el estado de la COVID-19 en España y en el mundo.
Utilizando datos actualizados facilitados por RTVE y los de múltiples fuentes oficiales (para minimizar la posibilidad de error), como el Ministerio de Sanidad, el Dipartimento della Protezione Civile de Italia, el Robert Koch Institute de Alemania o la estadounidense Johns Hopkins University, entre otros, Narrativa genera varios informes diarios del impacto del coronavirus en español, inglés e italiano que se actualizan cada 15 minutos en el caso de España y una hora para el resto del mundo.
El proyecto continúa vigente y se han generado cerca de 1.500.00 noticias en estos meses. La herramienta permite consultar las cifras de la COVID-19 en cualquier país del mundo e incluso recoge las estadísticas de diferentes regiones, estados o, en el caso de España, comunidades autónomas y provincias.
Además del acceso por web hay disponible una API que proporciona datos agregados. La agencia de noticias italiana ANSA utiliza la inteligencia artificial de Narrativa para sus noticias sobre la COVID-19, así como Infobae o Boston Globe oui STAT News (a través de Applied XL) ya que todo puede ser usado, descargado o compartido libremente por medios, instituciones, ONGs o cualquier persona. Diariamente acceden desde países del todo el mundo decenas de miles de usuarios para consultar la situación. Este proyecto de Narrativa, en el que RTVE es colaborador, fue premiado doblemente en Estados Unidos: Fast Company lo reconoció en la edición 2020 de los premios Innovation by Design y fue reconocido por Editor and Publisher en los premios EPPY, que valoraron el buen uso de los datos y la infografía en la página.
Data For Hope, un evento virtual y un desafío celebrado del 15 al 17 de abril con el apoyo de la Secrétaire d'État à la Digitalisation et à l'Intelligence Artificielle. La iniciativa surgió de EFE, RTVE, la empresa Narrativa y la consultora Cloud District, encargada de organizar este hackathon que reunió a más de 120 profesionales de ámbitos como la medicina, la tecnología, el periodismo, la administración pública, universidades o emprendedores. Del trabajo de estos tres días surgieron propuestas que intentan dar respuesta a distintos retos, todas ellas basadas en el uso lícito y ético de datos fiables y en la tecnología disponible. Las sesiones se centraron en:
– Modelos de predicción y evolución de la pandemia: Correlación entre estos datos y datos públicos (impacto de medidas, sistema sanitario, etc.). Para dar respuesta a preguntas como cuándo se colapsará este en una región determinada se ha optado por un modelo de datos unificado para el reporte desde hospitales, registros civiles y otras organizaciones al Gobierno.
– Modelos para prevención en África y Latinoamérica: Modelado de la pandemia para adelantar el impacto en el hemisferio sur, donde la calidad de los datos no permite hacerse una idea clara de la situación. La recomendación ha sido desarrollar una plataforma de recopilación de datos que permita entender el impacto de la Covid-19 en esos lugares y un portal en el que gobiernos, autoridades y líderes comunitarios puedan consultar una guía de actuación y recomendaciones adaptada a cada zona y nivel de alfabetización.
– Modelos basados en datos de Movilidad: Definición de políticas de movilidad. Modelos para levantamiento progresivo de limitaciones. El resultado ha sido un modelo dinámico y plataforma cartográfica activa basados en la evolución epidemiológica, el territorio y la movilidad de la población en tiempo real que sirvan de herramienta para la planificación estratégica y la toma de decisiones informadas durante la desescalada de medidas y orientada al control de la gestión de la epidemia y la propagación del virus. Para evaluar el riesgo de cada individuo y el impacto de su comportamiento en otros, se ha propuesto crear una red de datos donados por los usuarios, que garantice su privacidad y permita a las administraciones ofrecer herramientas para guiar sus decisiones.
Los resultados de estos trabajos sirvieron para desarrollar dos productos digitales, Futcov, una herramienta de autodiagnóstico realizada en colaboración con la RFEF y Mount Sinaí Hospital, y DataForYou, un application para dar contexto a los trayectos durante las fases de desescalada del coronavirus.
Como hemos visto, y siendo conscientes de todas sus posibilidades y de todas sus limitaciones, la Inteligencia Artificial y las tecnologías relacionadas no son en sí mismas ni buenas ni malas, es en el uso que se haga de ellas el que determinará su carácter y consecuencias.
Si pierde su neutralidad para ser negativa debemos tener la experiencia previa que nos permita conocer sus causas y efectos para, en lo posible, solucionarlos, prevenirlos o evitarlos. En su aplicación positiva son casi inimaginables las tareas en las que puede ser una ayuda y un ahorro. Desde la gestión energética reduciendo consumos y necesidades de mantenimiento; el análisis y gestión de grandes cantidades de documentos; hasta las propias de un medio de comunicación, como personalizar, descubrir o, en el caso de los redactores, liberarles de las tareas repetitivas para que puedan dedicarse a dar más profundidad, investigación o relevancia a informaciones más personales, con el objetivo de ganar así originalidad, mayor calidad y la diferencia respecto a otras ofertas, algo que, de momento, sigue teniendo una firma muy humana.
David Corral
Innovación RTVE
Artículo originalmente publicado en el Observatorio para la innovación de los Informativos en la Sociedad Digital (OI2)
Avez-vous aimé cet article ?
Abonnez-vous à notre BULLETIN et vous ne manquerez de rien.





















