Taalas HC1 : L’accélérateur IA câblé révolutionnant les performances de calcul

Taalas-HC1 hardwired AI accelerator

Selon cnx-software, le Taalas HC1 se présente comme un accélérateur d’IA câblé, intégrant le modèle Llama-3.1 8B. Avec une performance impressionnante atteignant près de 17 000 jetons/s, il surpasse les accélérateurs de centres de données, y compris les puces NVIDIA B200 et Cerebras.

Performance de 17 000 jetons/s et coût réduit : Taalas HC1 face aux puces NVIDIA

Le Taalas HC1 se distingue par sa rapidité, étant environ dix fois plus performant que la puce Cerebras. Non seulement il coûte 20 fois moins cher à produire, mais sa consommation énergétique est aussi dix fois inférieure. Toutefois, une limitation à noter est qu’il ne fonctionne qu’avec le modèle câblé Llama-3.1 8B. Néanmoins, il offre une certaine flexibilité grâce à une fenêtre contextuelle configurée et à la prise en charge du réglage fin via des adaptateurs de bas rang, appelés LoRA.

Accélérateur d'IA câblé Taalas-HC1 vs NVIDIA H200

Une architecture unifiée avec 53 milliards de transistors : le Taalas HC1 en détail

Les accelerators traditionnels disposent séparément de mémoire et de calcul, chacun fonctionnant à des vitesses distinctes, souvent limitées par la bande passante mémoire lors de l’utilisation de grands modèles linguistiques. En revanche, la technologie Taalas unifie le stockage et le calcul sur une seule puce, atteignant une densité similaire à celle de la DRAM, ce qui permet d’améliorer significativement les performances tout en réduisant la consommation d’énergie.

Une des utilisations potentielles de l’inférence ultra-rapide pourrait être sur des serveurs partageant des ressources entre plusieurs utilisateurs ou dans des robots dotés d’interaction vocale. Par exemple, lors de l’test du SunFounder Fusion HAT+, il a été observé qu’une invitation a été relayée à un service LLM (Gemini AI), avec un débit mesuré en jetons/s avant l’activation du moteur de synthèse vocale, ce qui entraîne des retards et rend la conversation moins fluide.

Concernant les spécificités de fabrication, la puce HC1 est réalisée par le processus 6 nm de TSMC, elle mesure 815 mm² et renferme 53 milliards de transistors.

Accélérateur d'IA câblé Taalas-HC1
Démonstrateur technologique Taalas HC1

L’entreprise propose une démonstration de chatbot en ligne, permettant à chacun de tester la rapidité de l’accélérateur. Lors de mes tests, le dispositif a atteint 19 997 jetons/s avec des questions simples comme « Qu’est-ce que 2+2 ? ». Pour des requêtes plus classiques telles que « Pourquoi le ciel est-il bleu ? », les performances étaient plutôt de l’ordre de 15K à 16K jetons/s. J’ai également posé une question plus complexe concernant la rédaction d’un livre, et le système a généré un aperçu en 0,064 s à 15 651 jetons/s, bien que les réponses puissent parfois manquer de précision en raison du modèle de 8 milliards de paramètres.

Enfin, l’entreprise travaille sur un second LLM de raisonnement de taille medium, toujours basé sur le silicium HC1, avec un lancement prévu au deuxième trimestre. Cette plateforme de deuxième génération, dénommée HC2, promet une densité accrue et des performances encore plus rapides, avec des déploiements anticipés d’ici la fin de l’année. Plus d’informations sont disponibles dans l’annonce officielle.