人工知能を使用して RTVE で持続可能な開発目標を可視化する
RTVE 団結することに尽力しています 持続可能な開発目標 国連が2030アジェンダの中で定めた、社会全体への目標。この目的を達成するために、人工知能の助けを借りて、活動における各 SDG の扱いの詳細なモニタリングが実行されます。
2015年、国連総会は持続可能な開発のための2030アジェンダを採択しました。彼の17 持続可能な開発目標 (SDG) は、貧困に終止符を打ち、地球を保護し、すべての人々が平和に成長し、尊厳のある生活を送れることを保証できる措置の導入を求める普遍的な要求となりました。
そうでなければ不可能であり、また公共サービスとして、RTVE はこれらの SDG を社会全体に近づけるという取り組みを獲得しました。
したがって、この約束の遵守を確実にするために、私たちの活動における各SDGsの扱いについて詳細なモニタリングが行われます。
これは簡単な作業ではありません。なぜなら、SDGs への注目は、目に見えて簡単に識別できる特定のキャンペーンや単著プログラムの形で具体化される場合もありますが、番組の一部として提供される情報であるため、またはニュース番組の一部として表示されるため、SDGs が話題になっているときに数値化するのがそれほど簡単ではない場合もあります。
多くの場合、このモニタリングの結果を、各 SDG に関連する内容に費やした時間のレポートと分析の形で国内または国際機関に提示する必要が生じます。歴史的に、これらの報道は手作業で行われており、断片やニュースで取り上げられた内容を詳細に分析して分析することは不可能であり、大量の人的資源と経済的資源を消費していました。
これに関連して、RTVEのイノベーション活動の一環として、研究グループと協力して概念実証(PoC)を実施することが決定されました。 知識の再利用 情報学部の カルロス 3 世大学 ニューラル ネットワークと最新の技術によって人工知能がどのようにサポートされているかを確認します。 自然言語処理、SDGsの普及という公共サービスの目的への遵守を評価するタスクを支援することができます。
上記すべてにおいて、イベントや時事問題を特徴とする番組であるため、毎日さまざまなトピックが多数含まれるため、有益な番組に焦点が当てられました。さらに、台本や概要などの追加の補助に頼ることなく、ニュースの放送から分析を開始するテストの一環として確立されました。
学んだことを再利用する
技術革新のエコシステムにおいて、RTVE では、最終的にすべてのプロジェクトが何らかの形で相互に関連するように、各活動で得た知識を活用して以下の内容を可能な限り充実させようとしているということを心に留めておいてください。
この哲学は、SDGs の自動分析の場合に特に役立ち、NLP、オントロジーの使用、以前のプロジェクトで取得したテキストを理解するためのルールの生成に関する知識に頼ることができました。例としては、 ソーシャルメディアレーダー (SMR) これは、ソーシャル ネットワークから収集したコメントの分析に基づいて、交通事故や気象現象がメディアに収集される前に発生したことを検出し、情報専門家にアラートを送信して、他のメディアに先駆けてニュースを準備できる可能性を提供します。 (ソーシャル メディア レーダー プロジェクト、マドリード、ISBN: 108283064X)。
この PoC のもう 1 つの興味深いプロジェクトは、ラジオ番組のセグメント化でした。このプロジェクトでは、スペインの企業 Etiqmedia のテクノロジーに基づいて、RNE ニュース番組の音声を参照し (プロジェクト全体を通じてプログラムは変更されました)、これをテキストに書き起こし、ニュースごとにセグメント化し、後で分類することができます。提供された結果と知識は、「ラジオ ニュース プログラムに適用された人工知能」という記事にまとめられています。 RNE における自動ニュースセグメンテーションのケーススタディ |インフォメーション プロフェッショナル ( professionaldelainformacion.com)
活動範囲
Al tratarse de un PoC se decidió trabajar únicamente con dos de los 17 ODS, en concreto el ODS 5 sobre “igualdad de género”, que persigue además empoderar a todas las mujeres y niñas, y el 13, que se ocupa del “cambio climático”, y que pretende tomar medidas urgentes para combatir éste y sus efectos.
La motivación de esta selección está en la garantía de que se refieren a temas de los que se habla de forma habitual en nuestros informativos, lo que asegura su tratamiento informativo casi a diario dado que, si las noticias sobre los ODS seleccionados se producen solo de forma esporádica, no se podrían evaluar los resultados con fiabilidad.
Un camino complejo
El sistema desarrollado parte del texto trascrito de los audios de un programa, siendo el paso siguiente el procesamiento de estos textos mediante la aplicación de tecnologías de PLN que son capaces de reconocer las entidades nombradas que pertenecen a una ontología concreta. A partir de este punto, el sistema clasifica el texto en función del ODS a los que pertenece la entidad y calcula el tiempo dedicado a hablar del mismo, generando métricas que sirven también para guardar en un modelo de datos adecuado la información asociada (fecha, hora, programa, texto, ODS…). Se ha puesto especial atención a la validación de los resultados mediante un riguroso control de calidad, proceso que se ha estado llevando a cabo por varios evaluadores a lo largo de todo el proyecto.
El paso final consiste en la visualización de los resultados mediante una herramienta capaz de utilizar filtros para presentar de diferentes formas la información seleccionada por cada usuario.
Y ahora… a probar
En los inicios del proyecto se utilizó el informativo de RNE de cuya transcripción y segmentación automática por noticias disponíamos gracias al proyecto de Innovación anteriormente mencionado. En este caso la segmentación va acompañada de los correspondientes códigos de tiempo, de forma que, cuando se detectaba que se estaba hablando de uno de los ODS a analizar, se asignaba todo el tiempo de la noticia a dicho ODS.
Los primeros resultados no fueron buenos, con aciertos en el entorno del 37%. El motivo principal de estos datos es que las ontologías iniciales, que consistían en vocabularios en bruto importados y traducidos de fuentes de la UE, no resultaban suficientes. Fue necesaria la ampliación de los términos con nombres propios de mujeres célebres, palabras derivadas, asociaciones, organismos, términos compuestos, etc. También lo fue la generación de patrones para la identificación de estructuras sintácticas en el texto para evitar que la aparición de forma aislada de palabras como “lluvia” o “mujer” llevara a clasificar el texto como ODS si no aparecía acompañada de algún término más de la ontología.
A veces hubo que aumentar más todavía la complejidad de estos patrones aplicando también reglas gramaticales como, por ejemplo [sujeto género] + [verbo violencia] + [sujeto de género], atendiendo a los resultados del proceso de validación. También se crearon reglas de transformación para términos que habitualmente la trascripción automática de voz a texto presentaba de forma errónea, por ejemplo “0 16” por “016, o “CO dos” por “CO2”. Obviamente la fiabilidad de la ontología requiere un mantenimiento continúo actualizando nuevos términos y patrones.
Ampliemos la muestra
Una vez alcanzado un porcentaje de aciertos superior al 90% se decidió dar un paso más y ampliar la muestra a los telediarios e informativos territoriales de TVE, aunque, lamentablemente, no disponíamos de las transcripciones de estos programas segmentados por noticias pudiendo contar únicamente con los textos generados para la subtitulación de los mismos.
Este cambio, aparentemente sin gran trascendencia, supuso en realidad un reto importante a la hora de medir tiempos ya que, ahora, cada segmento era un subtítulo y se desconocía su relación en cuanto a pertenencia o no a la misma noticia con los subtítulos adyacentes. También se daba el caso de que, a veces, un subtítulo es una unidad demasiado pequeña para poder hacer un análisis eficaz de su contenido.
Afrontar esta problemática obligó a definir una lógica para la agregación de subtítulos. Se optó por tomar como referencia los puntos finales de las oraciones de forma que los nuevos segmentos fueran frases completas.
El sistema siguió mostrándose eficaz detectando el segmento que hablaba de alguno de los ODS objeto del proyecto, pero no se sabía cuántos de los segmentos anteriores y/o posteriores formaban parte de la misma noticia cuando éstos no contenían suficiente información para que el sistema lo clasificara en alguno de los ODS, lo que impedía calcular el tiempo dedicado a hablar de cada ODS.
Para solventar este inconveniente se decidió aplicar un procedimiento algo complejo, pero con buenos resultados, que consiste en clasificar cada segmento por separado, comprobando después qué ocurre con los fragmentos adyacentes. Si el segmento de arriba y el de abajo son del mismo ODS, aunque el que se analiza no haya sido clasificado como tal, se considera que sí lo es. Se aplica la misma lógica hasta en dos segmentos contiguos. Con esto se ha conseguido que solo se produzca una mala clasificación cuando el segmento no detectado como perteneciente a un ODS es el primero o el último de una noticia.
Los resultados
La pieza clave del sistema es la presentación de los resultados, a la que se dedicaron no pocos esfuerzos en su diseño, dotándole de gran versatilidad para obtener los datos necesarios en cada ocasión. La herramienta permite seleccionar no solo qué datos se quieren visualizar sino también la forma en la que se desea hacerlo, pudiendo escoger entre varios tipos de gráficos, palabras clave, resumen de tiempos y ofreciendo además la posibilidad de aplicar filtros por fechas, programas, ODS…
La experiencia adquirida en este proyecto y los porcentajes de aciertos obtenidos nos hacen ser optimistas en el uso de las nuevas tecnologías para el análisis de contenidos audiovisuales, un impulso para continuar en esta línea avanzando en los próximos meses en la ampliación tanto del número de ODS analizados, intentando descender uno o más niveles hasta llegar a la detección y clasificación por categorías y subcategorías dentro de los ODS, como en el incremento de programas tratados. Aprendizaje fundamental ha sido la constatación de la necesidad de la intervención de expertos en las diferentes materias de las que se ocupan los ODS para una elaboración más precisa de las ontologías en cada caso.
También hemos tomado conciencia de la dificultad que va a suponer la clasificación en algunos casos ya que la línea que divide una categoría de la otra, y a veces un ODS de otro, es muy fina y esto aumenta las probabilidades de cometer errores.
Es importante constatar que el conocimiento generado y los procedimientos utilizados podrán servir para otros tipos de análisis de interés para otras actividades de la empresa. En definitiva, esta experiencia ha representado una mejora global en el análisis de nuestros contenidos permitiendo descender a niveles no viables anteriormente y una particular en cuanto a la utilización de la tecnología IA como herramienta en el cumplimiento de nuestro mandato y vocación de servicio público.
カルメン・ペレス・セルヌダ
Subdirectora Innovación y Estrategia Tecnológica en RTVE
Artículo originalmente publicado en el Observatorio para la innovación de los Informativos en la Sociedad Digital (OI2)
この記事は気に入りましたか?
購読してください ニュースレター 何も見逃すことはありません。





















