L’entreprise leader en intelligence artificielle nationale, Zhipu, a récemment publié des signaux techniques importants concernant les nouveaux modèles phares de génération suivante, GLM-5.4 et GLM-5.5. Il est rapporté que ces deux modèles très remarqués ne font pas seulement entrer officiellement le niveau des trillions dans l’échelle de paramètres, mais ouvrent également deux nouvelles voies d’exploration dans la structure technique de base, marquant une nouvelle étape vers l’intelligence artificielle générale (AGI) pour les modèles domestiques.
Du point de vue de l’évolution technique, le « nouveau modèle à double voie » révélé par Zhipu suscite une grande attention dans le secteur. D’un côté, alors que les grands modèles visent une taille maximale de paramètres, la manière dont ils peuvent atteindre un équilibre efficace entre entraînement et inférence à l’échelle très importante reste un problème central dans le domaine mondial de l’IA. Lorsque le nombre de paramètres atteint le niveau des trillions, les modèles possèdent non seulement un potentiel plus élevé pour les inférences complexes, le traitement de longs textes et la compréhension multimodale, mais ils exigent également des exigences extrêmement strictes en matière de planification de puissance informatique et d’optimisation algorithmique.
D’un autre côté, face à la tendance de la concurrence mondiale des grands modèles de données qui passe d’une simple compétition de paramètres à une prise en compte simultanée de l’efficacité et de l’efficience, Zhipu explore deux nouvelles lignes technologiques en parallèle, dans le but de briser les limites de performance des architectures traditionnelles. Selon les analyses des experts du secteur, cette disposition architecturale prospective permet de maintenir la forte capacité généralisée du modèle tout en améliorant significativement l’efficacité pour les tâches complexes spécifiques, et de réduire les barrières d’implémentation pour les applications à échelle d’entreprise.
Avec le développement progressif de GLM-5.4 et GLM-5.5, les grands modèles produits localement accélèrent leur rattrapage par rapport aux niveaux mondiaux de pointe en matière d’entraînement avec des paramètres ultra-lourds et d’innovations architecturales avancées. À l’avenir, avec la mise en œuvre officielle de ces modèles à un trillion de paramètres, leurs performances réelles dans des scénarios tels que la logique de raisonnement complexe et les agents intelligents spécialisés dans différents secteurs deviendront un indicateur important pour observer les avancées des technologies clés de l’IA chinoise.