{"id":4597,"date":"2021-11-15T10:39:06","date_gmt":"2021-11-15T09:39:06","guid":{"rendered":"https:\/\/telecomkh.info\/?p=4597"},"modified":"2022-06-21T19:01:25","modified_gmt":"2022-06-21T18:01:25","slug":"el-primer-sistema-masivo-de-inteligencia-artificial-de-la-lengua-espanola-maria-empieza-a-resumir-y-generar-textos","status":"publish","type":"post","link":"https:\/\/telecomkh.info\/?p=4597","title":{"rendered":"El primer sistema masivo de Inteligencia Artificial de la lengua espa\u00f1ola, MarIA, empieza a resumir y generar textos"},"content":{"rendered":"<p><strong>Cinco meses despu\u00e9s de su lanzamiento, el sistema expande sus capacidades para utilizar el lenguaje. Las aplicaciones creativas y empresariales, y aquellas relacionadas con la digitalizaci\u00f3n de la Administraci\u00f3n P\u00fablica aumentan<\/strong><\/p>\n<p>El proyecto MarIA, el sistema de modelos de lengua creado en el Barcelona Supercomputing Center \u2013 Centro Nacional de Supercomputaci\u00f3n (BSC-CNS), a partir de los archivos web de la Biblioteca Nacional de Espa\u00f1a (BNE) e impulsado por la Secretar\u00eda de Estado de Digitalizaci\u00f3n e Inteligencia Artificial (SEDIA) en el marco del Plan de Tecnolog\u00edas del Lenguaje, ha avanzado en su desarrollo y su nueva versi\u00f3n permite resumir textos existentes y crear nuevos textos a partir de titulares o de palabras.<br \/>\nEl proyecto MarIA es el primer sistema de inteligencia artificial masivo y experto en comprender y escribir en lengua espa\u00f1ola. Por su volumen y capacidades, ha situado a la lengua espa\u00f1ola en el tercer puesto de los idiomas que disponen de modelos masivos de acceso abierto, despu\u00e9s del ingl\u00e9s y el mandar\u00edn. Se ha construido a partir del patrimonio documental digital de la Biblioteca Nacional de Espa\u00f1a, que rastrea y archiva las webs elaboradas en espa\u00f1ol y se ha entrenado con el superordenador MareNostrum 4. Y se publica en abierto para que los desarrolladores de aplicaciones, compa\u00f1\u00edas, grupos de investigaci\u00f3n y la sociedad en general lo puedan utilizar en infinidad de uso.<br \/>\nLos \u00faltimos avances de MarIA constituyen un hito en la consecuci\u00f3n de objetivos de la Estrategia Nacional de Inteligencia Artificial y del Plan de Recuperaci\u00f3n, Transformaci\u00f3n y Resiliencia, con los que Espa\u00f1a pretende liderar a nivel mundial el desarrollo de herramientas, tecnolog\u00edas y aplicaciones para la proyecci\u00f3n y uso de la lengua espa\u00f1ola en los \u00e1mbitos de aplicaci\u00f3n de la IA. En concreto, el Plan Nacional de Tecnolog\u00edas del Lenguaje en el que se enmarca este proyecto, tiene como objetivo fomentar el desarrollo del procesamiento del lenguaje natural, la traducci\u00f3n autom\u00e1tica y los sistemas conversacionales en lengua espa\u00f1ola y lenguas cooficiales.<\/p>\n<p><strong>Modelos para comprender la lengua y modelos para generar textos<\/strong><br \/>\nUn modelo de lenguaje es un sistema de inteligencia artificial formado por conjunto de redes neuronales profundas que han sido entrenadas para adquirir una comprensi\u00f3n de la lengua, de su l\u00e9xico y de sus mecanismos para expresar el significado y escribir a nivel experto. Estos modelos estad\u00edsticos complejos que relacionan palabras en textos de modo sistem\u00e1tico y masivo, son capaces de \u201centender\u201d no s\u00f3lo conceptos abstractos, sino tambi\u00e9n el contexto de los mismos. Con estos modelos, los desarrolladores de diferentes aplicaciones pueden crear herramientas para m\u00faltiples usos, como clasificar documentos o crear correctores o herramientas de traducci\u00f3n.<br \/>\nLa primera versi\u00f3n de MarIA fue elaborada con RoBERTa, una tecnolog\u00eda que crea modelos del lenguaje del tipo \u201ccodificadores\u201d. Este tipo de modelos, dada una secuencia de texto, generan una interpretaci\u00f3n que puede servir para, por ejemplo, clasificar documentos, responder a preguntas tipo test, encontrar similitudes sem\u00e1nticas en diferentes redactados o detectar los sentimientos que se expresan en ellos.<br \/>\nLa nueva versi\u00f3n ha sido creada con GPT-2, una tecnolog\u00eda m\u00e1s avanzada que crea modelos generativos decodificadores y a\u00f1ade prestaciones al sistema. Los modelos decodificadores, dada una secuencia de texto pueden generar nuevos textos. Con ello, pueden servir, por ejemplo, para hacer res\u00famenes autom\u00e1ticos, simplificar redactados complicados a la medida de diferentes perfiles de usuario, generar preguntas y respuestas, mantener di\u00e1logos complejos con los usuarios e incluso redactar textos completos (que podr\u00edan parecer escritos por humanos) a partir de un titular o de un peque\u00f1o n\u00famero de palabras<br \/>\nEstas nuevas capacidades convierten a MarIA en una herramienta que, con entrenamientos \u201cad hoc\u201d adaptados a tareas espec\u00edficas, puede ser de gran utilidad para desarrolladores de aplicaciones, empresas y administraciones p\u00fablicas. Por ejemplo, los modelos que hasta ahora se han desarrollado en ingl\u00e9s se utilizan para generar sugerencias de texto en aplicaciones de escritura, para resumir contratos o los complicados documentos que detallan las prestaciones de un producto, en funci\u00f3n de lo que quiere saber cada usuario, y para buscar informaciones concretas dentro de grandes bases de datos de texto y relacionarlas con otras informaciones relevantes.<br \/>\n\u201cCon proyectos como MarIA, que se ver\u00e1n incorporados al \u2018PERTE para el desarrollo de una econom\u00eda digital en espa\u00f1ol,\u2019 damos pasos firmes hacia una inteligencia artificial que piense en espa\u00f1ol, lo que multiplicar\u00e1 las oportunidades econ\u00f3micas para las empresas y la industria tecnol\u00f3gica espa\u00f1ola. Porque la lengua es mucho m\u00e1s que un medio de comunicaci\u00f3n. Es una proyecci\u00f3n de la forma que tenemos de ver el mundo, tambi\u00e9n en la nueva realidad digital\u201d, se\u00f1ala la secretaria de Estado de Digitalizaci\u00f3n e Inteligencia Artificial, Carme Artigas.<br \/>\n\u201cComo instituci\u00f3n responsable del dep\u00f3sito legal electr\u00f3nico, la Biblioteca Nacional de Espa\u00f1a (BNE) conserva millones de sitios web, millones de palabras que se repiten en un contexto determinado y que son producto de muchas recolecciones de la web espa\u00f1ola, tanto de dominio.es como selectivas, realizadas desde hace a\u00f1os por los equipos de la BNE, lo que conforma el gran corpus del espa\u00f1ol que hoy se habla en nuestro pa\u00eds \u2014 Explica Ana Santos, directora de la BNE\u2014. Para nosotros es una gran satisfacci\u00f3n que estos archivos resulten de utilidad para este proyecto pionero, basado en tecnolog\u00edas de inteligencia artificial, que va a permitir que las m\u00e1quinas puedan comprender y escribir en lengua espa\u00f1ola, lo que supone un hito en el campo del procesamiento del lenguaje natural\u201d<br \/>\n\u201cAgradecemos la iniciativa de la SEDIA de impulsar temas de futuro, como la potenciaci\u00f3n del idioma espa\u00f1ol en el mundo digital y el entorno de la IA \u2014 afirma el director del BSC-CNS, Mateo Valero\u2014. Estamos encantados de poner nuestros expertos en lenguaje natural e inteligencia artificial y la capacidad de c\u00e1lculo de nuestras infraestructuras al servicio de los retos relevantes para la sociedad, como al que da respuesta esta iniciativa\u201d.<\/p>\n<p><strong>Entrenada con m\u00e1s de 135 mil millones de palabras y 9,7 trillones de operaciones<\/strong><br \/>\nEn los modelos del lenguaje, el n\u00famero de par\u00e1metros con los que se entrena el sistema es el elemento que les aporta mayor capacidad de generalizaci\u00f3n y, por tanto, inteligencia. Los datos de la Biblioteca Nacional con los que se ha entrenado MarIA est\u00e1n constituidos por m\u00e1s de 135 mil millones de palabras (135.733.450.668, concretamente), que ocupan un total de 570 Gigabytes.<br \/>\nPara crear y entrenar a MarIA se ha utilizado el superordenador MareNostrum del BSC y ha sido necesaria una potencia de c\u00e1lculo de 9,7 trillones de operaciones (969.exaflops). Un flop (operaci\u00f3n de coma flotante) es la unidad de medida con que se expresa la capacidad de c\u00e1lculo de un superordenador por segundo y exa es el prefijo que expresa 1018, es decir, un trill\u00f3n.<br \/>\nDe estos 969 exaflops, 201 fueron necesarios para procesar los datos procedentes de la Biblioteca Nacional, eliminar todo aquello que no fuera texto bien formado (n\u00fameros de p\u00e1ginas, gr\u00e1ficos, oraciones que no terminan, codificaciones err\u00f3neas, oraciones duplicadas, otros idiomas, etc.) y guardar solamente los textos correctos en lengua espa\u00f1ola, tal y como es realmente utilizada. Los restantes 768 exaflops se utilizaron para entrenar las redes neuronales del modelo GPT-2.<\/p>\n<p><strong>Pr\u00f3ximos pasos a dar<\/strong><br \/>\nLa versi\u00f3n actual de MarIA dar\u00e1 ahora lugar a versiones especializadas en distintas \u00e1reas de aplicaci\u00f3n, incluyendo biomedicina y legal, y evolucionar\u00e1 para resolver los problemas espec\u00edficos mencionados anteriormente.<br \/>\nEn paralelo el PlanTL continuara expandiendo MarIA para: adaptarse a los nuevos desarrollos tecnol\u00f3gicos en procesamiento del lenguaje natural (modelos mas complejos que el GP-T2 ahora implementado) entrenados con mayor cantidad de datos, crear espacios de trabajo para facilitar el uso de MarIA por compa\u00f1\u00edas y grupos de investigaci\u00f3n en los entornos computaciones adecuados y embeberlos en sistemas de evaluaci\u00f3n y certificaci\u00f3n de la calidad de los sistemas desarrollados en distintos dominios.<\/p>\n<p><span style=\"color: #999999;\"><em>Arriba, imagen cortes\u00eda del Ministerio de Asuntos Econ\u00f3micos y Transformaci\u00f3n Digital <\/em><\/span><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Cinco meses despu\u00e9s de su lanzamiento, el sistema expande sus capacidades para utilizar el lenguaje. Las aplicaciones creativas y empresariales, y aquellas relacionadas con la digitalizaci\u00f3n de la Administraci\u00f3n P\u00fablica aumentan El proyecto MarIA, el sistema de modelos de lengua creado en el Barcelona Supercomputing Center \u2013 Centro Nacional de Supercomputaci\u00f3n (BSC-CNS), a partir de &hellip; <\/p>\n<p class=\"link-more\"><a href=\"https:\/\/telecomkh.info\/?p=4597\" class=\"more-link\">Continue reading<span class=\"screen-reader-text\"> \u00abEl primer sistema masivo de Inteligencia Artificial de la lengua espa\u00f1ola, MarIA, empieza a resumir y generar textos\u00bb<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":4598,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":[],"categories":[9,69],"tags":[],"_links":{"self":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/4597"}],"collection":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=4597"}],"version-history":[{"count":1,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/4597\/revisions"}],"predecessor-version":[{"id":4599,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/4597\/revisions\/4599"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/media\/4598"}],"wp:attachment":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=4597"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=4597"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=4597"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}