{"id":13368,"date":"2023-08-08T14:34:32","date_gmt":"2023-08-08T13:34:32","guid":{"rendered":"https:\/\/telecomkh.info\/?p=13368"},"modified":"2023-08-08T14:35:14","modified_gmt":"2023-08-08T13:35:14","slug":"tokyo-tech-la-universidad-de-tohoku-fujitsu-y-riken-inician-una-colaboracion-para-desarrollar-el-entrenamiento-distribuido-de-grandes-modelos-linguisticos-de-ia","status":"publish","type":"post","link":"https:\/\/telecomkh.info\/?p=13368","title":{"rendered":"Tokyo Tech, la Universidad de Tohoku, Fujitsu y RIKEN inician una colaboraci\u00f3n para desarrollar el entrenamiento distribuido de grandes modelos ling\u00fc\u00edsticos de IA"},"content":{"rendered":"<p><strong>Se prev\u00e9 que un gran n\u00famero de ingenieros participen en el proyecto para crear modelos de IA eficientes, que conduzcan a la pr\u00f3xima generaci\u00f3n de investigadores e impulsando grandes avances tanto en la econom\u00eda como en el desarrollo de la sociedad 5.0<\/strong><\/p>\n<p>El Instituto Tecnol\u00f3gico de Tokio (Tokyo Tech), la Universidad de Tohoku, Fujitsu Limited y RIKEN han anunciado que se embarcar\u00e1n en la investigaci\u00f3n y el desarrollo de un entrenamiento distribuido de grandes modelos ling\u00fc\u00edsticos (LLM) (1) en el superordenador Fugaku, dentro del \u00e1mbito de las iniciativas para el uso de Fugaku.<br \/>\nLos LLM son modelos de IA para el aprendizaje profundo que sirven como n\u00facleo de la IA generativa, incluido ChatGPT (2). Las cuatro organizaciones pretenden mejorar el entorno para la creaci\u00f3n de LLM que puedan ser ampliamente utilizados por el mundo acad\u00e9mico y las empresas, contribuir a mejorar las capacidades de investigaci\u00f3n de la IA en Jap\u00f3n y aumentar el valor de la utilizaci\u00f3n de Fugaku tanto en el \u00e1mbito acad\u00e9mico como en el industrial mediante la divulgaci\u00f3n de los resultados de esta I+D en el futuro.<\/p>\n<p><strong>Antecedentes<\/strong><br \/>\nAunque muchos prev\u00e9n que los LLM y la IA generativa desempe\u00f1ar\u00e1n un papel fundamental en la investigaci\u00f3n y el desarrollo de tecnolog\u00edas para la seguridad, la econom\u00eda y la sociedad en general, el avance y el perfeccionamiento de estos modelos requerir\u00e1 recursos inform\u00e1ticos de alto rendimiento que puedan procesar de forma eficiente grandes cantidades de datos.<br \/>\nTokyo Tech, la Universidad de Tohoku, Fujitsu y RIKEN est\u00e1n llevando a cabo una iniciativa con este fin que se centrar\u00e1 en la investigaci\u00f3n y el desarrollo para la formaci\u00f3n distribuida de LLM.<\/p>\n<p><strong>Periodo de implementaci\u00f3n<\/strong><br \/>\nDel 24 de mayo de 2023 al 31 de marzo de 2024 *Periodo de la iniciativa de uso de Fugaku para las pol\u00edticas japonesas.<\/p>\n<p><strong>Funciones de cada organizaci\u00f3n y empresa<\/strong><br \/>\nLa tecnolog\u00eda utilizada en esta iniciativa permitir\u00e1 a las organizaciones llevar a cabo de forma eficiente el entrenamiento de modelos ling\u00fc\u00edsticos a gran escala en el entorno de computaci\u00f3n paralela a gran escala del superordenador Fugaku. Las funciones de cada organizaci\u00f3n y empresa son las siguientes:<br \/>\n\u2022 Instituto Tecnol\u00f3gico de Tokio: Supervisi\u00f3n de los procesos generales, paralelizaci\u00f3n y aceleraci\u00f3n de los LLM.<br \/>\n\u2022 Universidad de Tohoku: Recopilaci\u00f3n de datos de aprendizaje, selecci\u00f3n de modelos<br \/>\n\u2022 Fujitsu: Aceleraci\u00f3n de los LLM<br \/>\n\u2022 RIKEN: paralelizaci\u00f3n distribuida y aceleraci\u00f3n de la comunicaci\u00f3n de los LLM, aceleraci\u00f3n de los LLM<\/p>\n<p><strong>Planes de futuro<\/strong><br \/>\nPara ayudar a los investigadores e ingenieros japoneses a desarrollar LLM en el futuro, las cuatro organizaciones tienen previsto publicar en GitHub (3) y Hugging Face (4) los resultados de investigaci\u00f3n obtenidos en el \u00e1mbito de las iniciativas de uso de Fugaku definidas por la pol\u00edtica japonesa en el ejercicio 2024. Tambi\u00e9n se prev\u00e9 que muchos investigadores e ingenieros participen en la mejora del modelo b\u00e1sico y en nuevas investigaciones aplicadas para crear m\u00e9todos eficientes que conduzcan a la pr\u00f3xima generaci\u00f3n de investigaciones innovadoras y resultados empresariales.<br \/>\nLas cuatro organizaciones estudiar\u00e1n adem\u00e1s la posibilidad de colaborar con la Universidad de Nagoya, que desarrolla m\u00e9todos de generaci\u00f3n de datos y aprendizaje para aplicaciones multimodales en campos industriales como la fabricaci\u00f3n, y CyberAgent, Inc, que proporciona datos y tecnolog\u00eda para construir LLM.<br \/>\nComentario de Toshio Endo, profesor del Centro Global de Informaci\u00f3n Cient\u00edfica y Computaci\u00f3n del Instituto Tecnol\u00f3gico de Tokio: \u00abLa colaboraci\u00f3n integrar\u00e1 la paralelizaci\u00f3n y aceleraci\u00f3n de modelos ling\u00fc\u00edsticos a gran escala utilizando el superordenador \u00abFugaku\u00bb de Tokyo Tech y RIKEN, el desarrollo por parte de Fujitsu de software de infraestructura inform\u00e1tica de alto rendimiento para Fugaku y el ajuste del rendimiento de los modelos de IA, y la tecnolog\u00eda de procesamiento del lenguaje natural de la Universidad de Tohoku. En colaboraci\u00f3n con Fujitsu, tambi\u00e9n utilizaremos el peque\u00f1o laboratorio de investigaci\u00f3n que establecimos con el nombre de \u00abFujitsu Collaborative Research Center for Next Generation Computing Infrastructure\u00bb. Estamos deseando trabajar junto a nuestros colegas para contribuir a la mejora de las capacidades de investigaci\u00f3n en IA de Jap\u00f3n, aprovechando las capacidades de aprendizaje profundo distribuido a gran escala que ofrece \u00abFugaku\u00bb.<br \/>\nComentario de Kentaro Inui, profesor de la Escuela de Posgrado de Ciencias de la Informaci\u00f3n de la Universidad de Tohoku: \u00abNuestro objetivo es construir un modelo ling\u00fc\u00edstico a gran escala que sea de c\u00f3digo abierto, disponible para uso comercial y basado principalmente en datos japoneses, con transparencia en sus datos de entrenamiento. Al permitir la trazabilidad de los datos de aprendizaje, prevemos que esto facilitar\u00e1 una investigaci\u00f3n lo suficientemente s\u00f3lida como para verificar cient\u00edficamente cuestiones relacionadas con el problema de la caja negra, el sesgo, la desinformaci\u00f3n y los denominados fen\u00f3menos de \u00abalucinaci\u00f3n\u00bb comunes a la IA. Aprovechando los conocimientos adquiridos con el aprendizaje profundo del procesamiento del lenguaje natural japon\u00e9s desarrollado en la Universidad de Tohoku, construiremos modelos a gran escala. Esperamos contribuir a la mejora de las capacidades de investigaci\u00f3n de la IA en nuestro pa\u00eds y fuera de \u00e9l, compartiendo los resultados de la investigaci\u00f3n que obtengamos a trav\u00e9s de la iniciativa para investigadores y desarrolladores.\u00bb<br \/>\nComentario de Seishi Okamoto, EVP, director de Fujitsu Research, Fujitsu Limited: \u00abEstamos entusiasmados con la oportunidad de aprovechar los potentes recursos de computaci\u00f3n paralela del superordenador Fugaku para impulsar la investigaci\u00f3n en IA y avanzar en la investigaci\u00f3n y el desarrollo de LLMS. De cara al futuro, nuestro objetivo es incorporar los frutos de esta investigaci\u00f3n a la nueva plataforma de IA de Fujitsu, cuyo nombre en clave es \u00abKozuchi\u00bb, para ofrecer aplicaciones que cambien los paradigmas y contribuyan a la consecuci\u00f3n de una sociedad sostenible\u00bb.<br \/>\nComentario de Satoshi Matsuoka, director del Centro RIKEN de Ciencia Computacional: \u00abLa CPU A64FX (5) est\u00e1 equipada con una funci\u00f3n de aceleraci\u00f3n de IA conocida como SVE.<br \/>\nSin embargo, el desarrollo y la optimizaci\u00f3n del software son esenciales para maximizar sus capacidades y utilizarla en aplicaciones de IA. Creemos que esta investigaci\u00f3n conjunta desempe\u00f1ar\u00e1 un papel importante al reunir a expertos en LLM y ciencias de la computaci\u00f3n de Jap\u00f3n, incluidos los investigadores e ingenieros del R-CCS de RIKEN, para avanzar en las t\u00e9cnicas de construcci\u00f3n de LLM en el superordenador \u00abFugaku\u00bb. Junto con nuestros colaboradores, contribuimos a la realizaci\u00f3n de la Sociedad 5.0&#8243;.<\/p>\n<p><strong>Nombre del proyecto<\/strong><br \/>\nEntrenamiento distribuido de grandes modelos ling\u00fc\u00edsticos en Fugaku (N\u00famero de proyecto: hp230254)<\/p>\n<p><strong>Notas<\/strong><br \/>\n&#8211; [1] Grandes modelos ling\u00fc\u00edsticos: Redes neuronales con cientos de millones a miles de millones de par\u00e1metros que se han aprendido previamente utilizando grandes cantidades de datos. Recientemente, GPT en el procesamiento del lenguaje y ViT en el procesamiento de im\u00e1genes son conocidos como modelos representativos de aprendizaje a gran escala.<br \/>\n&#8211; [2] ChatGPT: Modelo ling\u00fc\u00edstico a gran escala para el procesamiento del lenguaje natural desarrollado por OpenAI que admite tareas como los sistemas interactivos y la generaci\u00f3n autom\u00e1tica de frases con gran precisi\u00f3n.<br \/>\n&#8211; [3] GitHub: Plataforma utilizada para publicar software de c\u00f3digo abierto en todo el mundo.<br \/>\n&#8211; [4] Hugging Face : Plataforma utilizada para publicar conjuntos de datos de IA en todo el mundo.<br \/>\n&#8211; [5] A64FX: Una CPU basada en ARM desarrollada por Fujitsu e instalada en el superordenador Fugaku.<\/p>\n<p><span style=\"color: #999999;\"><em>Arriba, en la foto, Seishi Okamoto, EVP, director de Fujitsu Research, Fujitsu Limited \/ Imagen cortes\u00eda de Fujitsu Research<\/em><\/span><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Se prev\u00e9 que un gran n\u00famero de ingenieros participen en el proyecto para crear modelos de IA eficientes, que conduzcan a la pr\u00f3xima generaci\u00f3n de investigadores e impulsando grandes avances tanto en la econom\u00eda como en el desarrollo de la sociedad 5.0 El Instituto Tecnol\u00f3gico de Tokio (Tokyo Tech), la Universidad de Tohoku, Fujitsu Limited &hellip; <\/p>\n<p class=\"link-more\"><a href=\"https:\/\/telecomkh.info\/?p=13368\" class=\"more-link\">Continue reading<span class=\"screen-reader-text\"> \u00abTokyo Tech, la Universidad de Tohoku, Fujitsu y RIKEN inician una colaboraci\u00f3n para desarrollar el entrenamiento distribuido de grandes modelos ling\u00fc\u00edsticos de IA\u00bb<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":13369,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":[],"categories":[9],"tags":[],"_links":{"self":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/13368"}],"collection":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=13368"}],"version-history":[{"count":2,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/13368\/revisions"}],"predecessor-version":[{"id":13371,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/13368\/revisions\/13371"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/media\/13369"}],"wp:attachment":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=13368"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=13368"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=13368"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}