{"id":19466,"date":"2024-11-27T18:06:57","date_gmt":"2024-11-27T17:06:57","guid":{"rendered":"https:\/\/telecomkh.info\/?p=19466"},"modified":"2024-11-27T18:06:57","modified_gmt":"2024-11-27T17:06:57","slug":"lanzamiento-de-fugaku-llm-un-gran-modelo-linguistico-entrenado-en-el-superordenador-fugaku","status":"publish","type":"post","link":"https:\/\/telecomkh.info\/?p=19466","title":{"rendered":"Lanzamiento de \u00abFugaku-LLM\u00bb, un gran modelo ling\u00fc\u00edstico entrenado en el superordenador \u00abFugaku\u00bb"},"content":{"rendered":"<p><strong>Se desarroll\u00f3 un gran modelo ling\u00fc\u00edstico con capacidad mejorada para el idioma japon\u00e9s utilizando tecnolog\u00eda de supercomputaci\u00f3n japonesa<\/strong><\/p>\n<p>Un equipo de investigadores de Jap\u00f3n ha presentado Fugaku-LLM, un gran modelo ling\u00fc\u00edstico (1) con capacidad mejorada para el idioma japon\u00e9s, utilizando el superordenador Fugaku de RIKEN. El equipo est\u00e1 dirigido por el profesor Rio Yokota, del Instituto Tecnol\u00f3gico de Tokio, el profesor asociado Keisuke Sakaguchi, de la Universidad de Tohoku, Koichi Shirahata, de Fujitsu Limited, el jefe de equipo Mohamed Wahib, de RIKEN, el profesor asociado Koji Nishiguchi, de la Universidad de Nagoya, Shota Sasaki, de CyberAgent, Inc, y Noriyuki Kojima, de Kotoba Technologies Inc.<br \/>\nPara entrenar grandes modelos ling\u00fc\u00edsticos en Fugaku, los investigadores desarrollaron m\u00e9todos de entrenamiento distribuido, incluida la portabilidad del marco de aprendizaje profundo Megatron-DeepSpeed a Fugaku con el fin de optimizar el rendimiento de Transformers en Fugaku. Aceleraron la biblioteca de multiplicaci\u00f3n de matrices densas para Transformers y optimizaron el rendimiento de la comunicaci\u00f3n para Fugaku combinando tres tipos de t\u00e9cnicas de paralelizaci\u00f3n y aceleraron la biblioteca de comunicaci\u00f3n colectiva en la interconexi\u00f3n D de Tofu.<br \/>\nFugaku-LLM tiene 13.000 millones de par\u00e1metros (2) y es mayor que los modelos de 7.000 millones de par\u00e1metros que se han desarrollado ampliamente en Jap\u00f3n. Fugaku-LLM tiene capacidades japonesas mejoradas, con una puntuaci\u00f3n media de 5,5 en el MT-Bench japon\u00e9s (3), el rendimiento m\u00e1s alto entre los modelos abiertos que se entrenan utilizando datos originales producidos en Jap\u00f3n. En concreto, el rendimiento de referencia para tareas de humanidades y ciencias sociales alcanz\u00f3 una puntuaci\u00f3n notablemente alta de 9,18.<br \/>\nFugaku-LLM se entren\u00f3 con datos japoneses propios recopilados por CyberAgent, junto con datos ingleses y de otros pa\u00edses. El c\u00f3digo fuente de Fugaku-LLM est\u00e1 disponible en GitHub (4) y el modelo en Hugging Face (5). Fugaku-LLM puede utilizarse con fines de investigaci\u00f3n y comerciales siempre que los usuarios respeten la licencia.<br \/>\nEn el futuro, a medida que m\u00e1s investigadores e ingenieros participen en la mejora de los modelos y sus aplicaciones, se mejorar\u00e1 la eficiencia del entrenamiento, lo que conducir\u00e1 a aplicaciones empresariales y de investigaci\u00f3n innovadoras de pr\u00f3xima generaci\u00f3n, como la vinculaci\u00f3n de la simulaci\u00f3n cient\u00edfica y la IA generativa, y la simulaci\u00f3n social de comunidades virtuales con miles de IA.<\/p>\n<p><strong>Antecedentes<\/strong><br \/>\nEn los \u00faltimos a\u00f1os, el desarrollo de grandes modelos ling\u00fc\u00edsticos (LLM) ha sido muy activo, especialmente en Estados Unidos. En particular, la r\u00e1pida difusi\u00f3n de ChatGPT (6), desarrollado por OpenAI, ha tenido un profundo impacto en la investigaci\u00f3n y el desarrollo, los sistemas econ\u00f3micos y la seguridad nacional. Otros pa\u00edses, adem\u00e1s de Estados Unidos, tambi\u00e9n est\u00e1n invirtiendo enormes recursos humanos y computacionales para desarrollar LLM en sus propios pa\u00edses. Jap\u00f3n tambi\u00e9n necesita asegurarse recursos computacionales para la investigaci\u00f3n de la IA y no quedarse atr\u00e1s en esta carrera mundial. Hay grandes expectativas puestas en Fugaku, el sistema de supercomputaci\u00f3n insignia de Jap\u00f3n, y es necesario mejorar el entorno computacional para el entrenamiento distribuido a gran escala en Fugaku para cumplir estas expectativas.<br \/>\nPor ello, el Instituto Tecnol\u00f3gico de Tokio, la Universidad de Tohoku, Fujitsu, RIKEN, la Universidad de Nagoya, CyberAgent y Kotoba Technologies han iniciado un proyecto conjunto de investigaci\u00f3n sobre el desarrollo de grandes modelos ling\u00fc\u00edsticos.<\/p>\n<p><strong>Papel de cada instituci\u00f3n\/empresa<\/strong><\/p>\n<p>Instituto Tecnol\u00f3gico de Tokio: Supervisi\u00f3n general, paralelizaci\u00f3n y aceleraci\u00f3n de la comunicaci\u00f3n de grandes modelos ling\u00fc\u00edsticos (optimizaci\u00f3n del rendimiento de la comunicaci\u00f3n combinando tres tipos de paralelizaci\u00f3n, aceleraci\u00f3n de la comunicaci\u00f3n colectiva en la interconexi\u00f3n D de Tofu).<\/p>\n<p>Universidad de Tohoku: Recogida de datos de entrenamiento y selecci\u00f3n de modelos<\/p>\n<p>Fujitsu: Aceleraci\u00f3n de la computaci\u00f3n y la comunicaci\u00f3n (aceleraci\u00f3n de la comunicaci\u00f3n colectiva en Tofu interconnect D, optimizaci\u00f3n del rendimiento de la paralelizaci\u00f3n de canalizaciones) e implementaci\u00f3n del preentrenamiento y el ajuste fino tras el entrenamiento.<\/p>\n<p>RIKEN: Paralelizaci\u00f3n distribuida y aceleraci\u00f3n de la comunicaci\u00f3n de modelos ling\u00fc\u00edsticos a gran escala (aceleraci\u00f3n de la comunicaci\u00f3n colectiva en Tofu interconnect D).<\/p>\n<p>Universidad de Nagoya: Estudio sobre m\u00e9todos de aplicaci\u00f3n de Fugaku-LLM a la IA generativa 3D<\/p>\n<p>CyberAgent: Suministro de datos de entrenamiento<\/p>\n<p>Tecnolog\u00edas Kotoba: Adaptaci\u00f3n del marco de aprendizaje profundo a Fugaku<\/p>\n<p><strong>Resultados de la investigaci\u00f3n<\/strong><\/p>\n<p><strong>1. Mejora significativa del rendimiento computacional del entrenamiento de grandes modelos ling\u00fc\u00edsticos en el superordenador Fugaku.<\/strong><br \/>\nLas GPU (7) son el hardware m\u00e1s utilizado para entrenar grandes modelos ling\u00fc\u00edsticos. Sin embargo, hay una escasez mundial de GPU debido a la gran inversi\u00f3n de muchos pa\u00edses para entrenar LLM. En estas circunstancias, es importante demostrar que se pueden entrenar grandes modelos ling\u00fc\u00edsticos con Fugaku, que utiliza CPU en lugar de GPU. Las CPU utilizadas en Fugaku son CPU japonesas fabricadas por Fujitsu, y desempe\u00f1an un papel importante en t\u00e9rminos de revitalizaci\u00f3n de la tecnolog\u00eda japonesa de semiconductores.<br \/>\nAl extraer todo el potencial de Fugaku, este estudio logr\u00f3 aumentar la velocidad de c\u00e1lculo de la multiplicaci\u00f3n de matrices en un factor de 6, y la velocidad de comunicaci\u00f3n en un factor de 3. Para maximizar el rendimiento del entrenamiento distribuido en Fugaku, el marco de aprendizaje profundo Megatron-DeepSpeed se port\u00f3 a Fugaku, y la biblioteca de multiplicaci\u00f3n de matrices densas se aceler\u00f3 para Transformer. Para la aceleraci\u00f3n de la comunicaci\u00f3n, los investigadores optimizaron el rendimiento de la comunicaci\u00f3n para Fugaku mediante la combinaci\u00f3n de tres tipos de t\u00e9cnicas de paralelizaci\u00f3n y aceleraron la comunicaci\u00f3n colectiva en la interconexi\u00f3n D de Tofu. El conocimiento adquirido a partir de estos esfuerzos se puede utilizar en el dise\u00f1o de la infraestructura inform\u00e1tica de pr\u00f3xima generaci\u00f3n despu\u00e9s de Fugaku y mejorar\u00e1 en gran medida la ventaja futura de Jap\u00f3n en el campo de la IA.<\/p>\n<p><strong>2. Un gran modelo ling\u00fc\u00edstico f\u00e1cil de usar, abierto y seguro con 13.000 millones de par\u00e1metros<\/strong><br \/>\nEn 2023, las empresas japonesas han desarrollado muchos modelos ling\u00fc\u00edsticos de gran tama\u00f1o, pero la mayor\u00eda de ellos tienen menos de 7.000 millones de par\u00e1metros. Dado que el rendimiento de los modelos ling\u00fc\u00edsticos a gran escala suele mejorar a medida que aumenta el n\u00famero de par\u00e1metros, es probable que el modelo de 13.000 millones de par\u00e1metros desarrollado por el equipo de investigaci\u00f3n sea m\u00e1s potente que otros modelos japoneses. Aunque fuera de Jap\u00f3n se han desarrollado modelos de mayor tama\u00f1o, los grandes modelos ling\u00fc\u00edsticos tambi\u00e9n requieren grandes recursos computacionales, lo que dificulta el uso de modelos con demasiados par\u00e1metros. Fugaku-LLM es a la vez de alto rendimiento y equilibrado.<br \/>\nAdem\u00e1s, la mayor\u00eda de los modelos desarrollados por empresas japonesas emplean el aprendizaje continuo (8), en el que los modelos abiertos desarrollados fuera de Jap\u00f3n se entrenan continuamente con datos japoneses. En cambio, Fugaku-LLM se entrena desde cero utilizando los propios datos del equipo, por lo que se puede entender todo el proceso de aprendizaje, lo que es superior en t\u00e9rminos de transparencia y seguridad.<br \/>\nFugaku-LLM se entren\u00f3 con 380.000 millones de tokens utilizando 13.824 nodos de Fugaku, y alrededor del 60% de los datos de entrenamiento eran japoneses, combinados con ingl\u00e9s, matem\u00e1ticas y c\u00f3digo. En comparaci\u00f3n con los modelos que se entrenan continuamente en japon\u00e9s, Fugaku-LLM aprendi\u00f3 gran parte de su informaci\u00f3n en japon\u00e9s. Fugaku-LLM es el mejor modelo entre los modelos abiertos producidos en Jap\u00f3n y entrenados con datos originales. En concreto, se confirm\u00f3 que el modelo muestra una alta puntuaci\u00f3n de referencia de 9,18 en las tareas de humanidades y ciencias sociales. Se espera que el modelo sea capaz de realizar di\u00e1logos naturales basados en el keigo (habla honor\u00edfica) y otras caracter\u00edsticas de la lengua japonesa.<\/p>\n<p><strong>Desarrollo futuro<\/strong><br \/>\nLos resultados de esta investigaci\u00f3n se est\u00e1n haciendo p\u00fablicos a trav\u00e9s de GitHub y Hugging Face para que otros investigadores e ingenieros puedan utilizarlos para seguir desarrollando grandes modelos ling\u00fc\u00edsticos. Fugaku-LLM puede utilizarse con fines comerciales y de investigaci\u00f3n siempre que los usuarios respeten la licencia. Fugaku-LLM tambi\u00e9n se ofrecer\u00e1 a los usuarios a trav\u00e9s del Fujitsu Research Portal a partir del 10 de mayo de 2024.<br \/>\nEn el futuro, a medida que m\u00e1s investigadores e ingenieros participen en la mejora de los modelos y sus aplicaciones, se mejorar\u00e1 la eficacia de la formaci\u00f3n, lo que dar\u00e1 lugar a aplicaciones empresariales y de investigaci\u00f3n innovadoras de nueva generaci\u00f3n, como la vinculaci\u00f3n de la simulaci\u00f3n cient\u00edfica y la IA generativa, y la simulaci\u00f3n social de comunidades virtuales con miles de IA.<\/p>\n<p><span style=\"color: #ff6600;\"><strong>Notas<\/strong> <\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [1] Modelo de lenguaje de gran tama\u00f1o : Modela la probabilidad con la que aparece un texto y puede predecir el texto (respuesta) que sigue a un contexto dado (consulta).<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [2] Par\u00e1metro : Medida del tama\u00f1o de una red neuronal. Cuantos m\u00e1s par\u00e1metros, mayor es el rendimiento del modelo, pero m\u00e1s datos se necesitan para el entrenamiento.<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [3] MT-Bench japon\u00e9s : Prueba de referencia proporcionada por Stability AI.<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [4] GitHub : Plataforma utilizada para publicar software de c\u00f3digo abierto<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [5] Hugging Face : Plataforma utilizada para publicar conjuntos de datos de IA<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [6] ChatGPT : Un gran modelo ling\u00fc\u00edstico desarrollado por OpenAI, que ha provocado un gran cambio social, superando los 100 millones de usuarios en unos dos meses tras su lanzamiento.<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [7] GPU : Originalmente producido como un acelerador para gr\u00e1ficos, pero recientemente se ha utilizado para acelerar el aprendizaje profundo.<\/span><br \/>\n<span style=\"color: #ff6600;\">&#8211; [8] Aprendizaje continuo : M\u00e9todo para realizar un entrenamiento adicional en un gran modelo ling\u00fc\u00edstico que ya ha sido entrenado. Se utiliza para entrenar modelos ling\u00fc\u00edsticos en diferentes idiomas o dominios.<\/span><\/p>\n<p><span style=\"color: #999999;\"><em>Arriba, imagen cortes\u00eda de RIKEN<\/em><\/span><\/p>\n<p>&nbsp;<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Se desarroll\u00f3 un gran modelo ling\u00fc\u00edstico con capacidad mejorada para el idioma japon\u00e9s utilizando tecnolog\u00eda de supercomputaci\u00f3n japonesa Un equipo de investigadores de Jap\u00f3n ha presentado Fugaku-LLM, un gran modelo ling\u00fc\u00edstico (1) con capacidad mejorada para el idioma japon\u00e9s, utilizando el superordenador Fugaku de RIKEN. El equipo est\u00e1 dirigido por el profesor Rio Yokota, del &hellip; <\/p>\n<p class=\"link-more\"><a href=\"https:\/\/telecomkh.info\/?p=19466\" class=\"more-link\">Continue reading<span class=\"screen-reader-text\"> \u00abLanzamiento de \u00abFugaku-LLM\u00bb, un gran modelo ling\u00fc\u00edstico entrenado en el superordenador \u00abFugaku\u00bb\u00bb<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":19467,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":[],"categories":[69],"tags":[],"_links":{"self":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/19466"}],"collection":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=19466"}],"version-history":[{"count":1,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/19466\/revisions"}],"predecessor-version":[{"id":19468,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/posts\/19466\/revisions\/19468"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=\/wp\/v2\/media\/19467"}],"wp:attachment":[{"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=19466"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=19466"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/telecomkh.info\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=19466"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}