Selon cnx-software, le déploiement de modèles de langage locaux peut prêter à confusion, car on pourrait croire qu’un investissement plus conséquent garantit de meilleures performances. Cependant, la réalité est souvent différente. C’est en réponse à cette situation que Sipeed a élaboré le « Guide de déploiement du dispositif d’inférence LLM local de l’agent AI », disponible sur llmdev.guide.
Qwen3.5 9B et 4000 $ : performances comparables à un GPU à 260 $
Ce site propose une liste d’équipements variés avec des informations sur les prix, les performances mesurées en jetons par seconde et la consommation énergétique, entre autres. Par exemple, en examinant le modèle Qwen3.5 9B, nous constatons que des systèmes coûtant plus de 4 000 $, tels que le NVIDIA DGX Spark ou l’Apple Mac Studio M3, offrent des performances similaires à celles d’une machine équipée d’un Intel Arc B580 12 Go, disponible pour 260 $.

NVIDIA GTX 5090 32 Go se démarque pour 122B avec le meilleur rapport prix/performance
Pour ceux qui n’ont pas de limites budgétaires et qui recherchent de hautes performances, la NVIDIA GTX 5090 32 Go apparaît comme un choix judicieux. Il faut noter que les comparaisons de prix peuvent varier, certaines données reflétant le coût d’un système complet tandis que d’autres ne mentionnent que le prix d’une carte graphique. Néanmoins, pour le modèle Qwen 122B-A10B, il est évident que le NVIDIA DGX Spark offre un rapport qualité-prix optimal en comparaison avec l’Apple Mac Studio M3 Ultra 256 Go, bien que les options soient restreintes à cause de la mémoire élevée requise pour faire fonctionner ce modèle.

Analyse des performances Qwen 3.5 : options variées disponibles
Les utilisateurs peuvent explorer divers paramètres, y compris ceux liés aux axes X et Y ainsi qu’à la taille des bulles, en se fondant sur des spécifications telles que la bande passante, la capacité mémoire et les performances mesurées en TOPS, tout en tenant compte des résultats de sortie LLM et des ratios tels que Perf/watt ou Perf/dollars.

Le site utilise plusieurs modèles Qwen 3.5 pour évaluer les performances :
Le modèle Qwen3.5-9B est essentiel et sert de référence pour les petits dispositifs, tandis que le Qwen3.5-27B se positionne comme la norme pour le matériel de classe intermédiaire. D’autres variantes comme le Qwen3.5-35B-A3B (MoE) sont considérées comme facultatives et offrent des performances particulières, de même que le Qwen3.5-122B-A10B et le Qwen3.5-397B-A17B, qui se situent à l’extrémité haute du benchmark.
En matière de filtrage, le site n’offre pas encore l’option de trier par prix. Cependant, il est possible de sélectionner une échelle logarithmique afin de mieux visualiser le rapport prix/performance pour les options d’entrée de gamme.

Une autre possibilité permet de basculer vers une vue liste et de trier les résultats selon le prix.

En cliquant sur un élément de la liste ou sur une bulle dans le graphique, vous aurez accès à davantage de détails concernant chaque appareil, y compris les spécifications et les résultats des tests effectués.

Il est important de noter que certains résultats sont estimés. Par exemple, les performances du Qwen 3.5 9B sur le Raspberry Pi 5 16 Go ont été extrapolées à partir des données obtenues avec le modèle Llama 7B.
Contribution communautaire : étendre la liste du matériel
Le répertoire des matériels peut être enrichi, car le projet est ouvert aux soumissions de la part des utilisateurs. Pour proposer du nouveau matériel, il est nécessaire de déployer le benchmark et de suivre les directives fournies. Malheureusement, le système ne collecte pas de manière automatique les données, ce qui implique que l’utilisateur doit remplir manuellement toutes les informations après avoir copié un modèle dans le dossier dédié, puis exécuter le Qwen 3.5 9B avec une requête longue et photographier la carte. Pour encourager plus de contributions, une automatisation du processus serait bénéfique, comme le fait le script sbc-bench.sh ou un script d’assistant.

Pour ma part, j’avais commencé à réaliser ces tests pour le kit de développement UP Xtreme ARL AI. Toutefois, devant l’exigence de la saisie manuelle des données, je prévois de soumettre les résultats lors d’un week-end où je pourrai prendre le temps de travailler sur cela. Je suis ravi que cette ressource existe et j’espère qu’elle continuera à s’améliorer.
-
Guide Onde 70mm Plastique Renforcé Guide Onde 70mm Plastique(Hole Diameter 100mm)
-
Guide De Positionnement Précis Outil De Jauge De Coupe Avec Rail Ajustable
