Ein Forschungsteam des LRZ und Intel hat untersucht, wie sich große Sprachmodelle effizient auf dem Supercomputer SuperMUC-NG Phase 2 (SNG-2) trainieren lassen. Dabei wurden GPT-ähnliche Modelle mit bis zu 175 Mrd. Parametern auf einem wissenschaftlichen Hochleistungsrechner mit Intel-Beschleunigern getestet, um dessen Eignung für KI-Trainingsaufgaben zu bewerten. Im Zentrum standen Strategien zur Verteilung von Modellen und Trainingsdaten auf viele Rechenknoten und GPUs sowie zur Reduktion des Kommunikationsaufwands im System. Untersucht wurden dafür verschiedene Parallelisierungs- und Optimierungsansätze sowie eine automatisierte Abstimmung der Trainingsparameter zur effizienten Nutzung der Rechenleistung. Die Ergebnisse zeigen, dass sich große Sprachmodelle auf SNG-2 mit hoher Effizienz trainieren lassen, ohne dass umfangreiche Softwareanpassungen erforderlich sind. Damit bietet das LRZ Forschenden eine praktikable Alternative zu etablierten KI-Plattformen und schafft eine Grundlage für die Entwicklung zukünftiger, noch größerer KI-Modelle. Künftige Arbeiten sollen zudem Energieverbrauch und weitere Trainingsstrategien untersuchen. Weitere Informationen: lrz.de/news/detail/mit-sng2-sprachmodelle-trainieren .