- ▸ Un agrégateur de prix né sur Hacker News
- ▸ Vingt déclinaisons de Qwen, toutes affichées à zéro dollar
- ▸ Ce que « 0 $ » signale sur l'économie des modèles ouverts
- ▸ Décoder la nomenclature : A22B, Thinking, VL, Coder
Un agrégateur de prix d’API lancé en Show HN liste une vingtaine de modèles Alibaba à zéro dollar le million de tokens. Ce prix n’est pas une gratuité : il signale que la facture a quitté le fournisseur pour votre infrastructure. Décodage des modèles listés, de la mécanique du chiffre affiché, et de ce que « 0 $ » veut réellement dire pour une équipe technique qui doit budgéter une charge de production.
L’essentiel 1. CostPerPrompt, agrégateur présenté sur Hacker News, centralise le prix au million de tokens de dizaines de modèles et fournit des calculateurs de coût par charge réelle. 2. Une vingtaine de modèles Qwen — familles Qwen2.5 et Qwen3, de 7B à 480B de paramètres — y sont affichés à 0 $ le token. 3. Le 0 $ traduit l’économie des modèles à poids ouverts : sans redevance par token, la dépense migre vers le GPU, la mémoire et l’exploitation. 4. La gamme couvre quatre axes — Instruct, Thinking, Coder, Vision — et des architectures MoE (mélange d’experts) qui découplent taille totale et paramètres réellement actifs. 5. Notre lecture : l’outil déplace la question « quel est le prix » vers « quel est mon coût total par charge », que résume le champ de saisie du site, « how much will this cost ».
Un agrégateur de prix né sur Hacker News
Le format « Show HN » sert de rampe de lancement à des projets techniques que leurs auteurs soumettent au jugement de la communauté Hacker News. CostPerPrompt y arrive avec une promesse étroite et vérifiable : rassembler le tarif en vigueur des principales API de modèles de langage, puis laisser l’utilisateur simuler ce que coûterait une charge de travail concrète. Le site s’énonce lui-même comme un jeu de « live AI API pricing and real-workload cost calculators », soit du prix en direct doublé de calculateurs par usage réel.
L’intérêt d’un tel outil tient moins à l’esthétique qu’à la fraîcheur des données. Les grilles tarifaires des fournisseurs bougent, les modèles se démultiplient, et un développeur qui compare deux offres perd un temps considérable à recoller des pages de documentation. Un comparateur qui affiche côte à côte le prix au million de tokens répond à un besoin opérationnel banal mais mal servi. C’est sur ce terrain que le projet se juge, et c’est là qu’apparaît le chiffre le plus intrigant de sa base : une colonne entière de modèles Alibaba pointée à zéro.
Vingt déclinaisons de Qwen, toutes affichées à zéro dollar
En parcourant les entrées Alibaba (Qwen) de CostPerPrompt, un constat se répète ligne après ligne : le prix affiché est 0 $. Il ne s’agit pas d’une exception ponctuelle sur un petit modèle promotionnel, mais d’une gamme complète, des versions les plus légères jusqu’aux architectures massives. Le tableau ci-dessous regroupe un échantillon représentatif des déclinaisons listées.
| Modèle | Famille | Paramètres (total / actifs) | Spécialité | Prix affiché |
|---|---|---|---|---|
| Qwen2.5 7B Instruct | Qwen2.5 | 7B | Dialogue | 0 $ |
| Qwen2.5 72B Instruct | Qwen2.5 | 72B | Dialogue | 0 $ |
| Qwen2.5 Coder 32B Instruct | Qwen2.5 | 32B | Code | 0 $ |
| Qwen2.5 VL 72B Instruct | Qwen2.5 | 72B | Vision | 0 $ |
| Qwen3 8B | Qwen3 | 8B | Dense | 0 $ |
| Qwen3 32B | Qwen3 | 32B | Dense | 0 $ |
| Qwen3 30B A3B | Qwen3 | 30B / 3B actifs | MoE | 0 $ |
| Qwen3 235B A22B Instruct 2507 | Qwen3 | 235B / 22B actifs | MoE dialogue | 0 $ |
| Qwen3 235B A22B Thinking 2507 | Qwen3 | 235B / 22B actifs | MoE raisonnement | 0 $ |
| Qwen3 Coder 480B A35B | Qwen3 | 480B / 35B actifs | Code MoE | 0 $ |
| Qwen3 Next 80B A3B Thinking | Qwen3 Next | 80B / 3B actifs | MoE raisonnement | 0 $ |
| Qwen3 VL 235B A22B Instruct | Qwen3 | 235B / 22B actifs | Vision MoE | 0 $ |
La liste réelle est plus longue encore : Qwen3 14B, Qwen3 235B A22B en version de base, Qwen3 30B A3B Instruct 2507 et Thinking 2507, Qwen3 Coder 30B A3B Instruct, Qwen3 Next 80B A3B Instruct, Qwen3 VL 235B A22B Thinking, Qwen3 VL 30B A3B Instruct. Une vingtaine de références au total, toutes ramenées à la même valeur de départ.
480 milliards de paramètres, 0 dollar affiché. Le Qwen3 Coder 480B A35B, l’un des plus gros modèles de code publiés à poids ouverts, apparaît sur le comparateur au même prix que le Qwen3 8B : rien.
Ce nivellement par le bas mérite qu’on s’y arrête, parce qu’il ne se retrouve pas de l’autre côté du tableau. Les fournisseurs propriétaires — les grands laboratoires qui exposent leurs modèles uniquement derrière une API mesurée — n’affichent jamais zéro. Leur modèle économique repose précisément sur la facturation au token. Le contraste structurel entre ces deux colonnes est le vrai sujet, davantage que le montant exact de telle ou telle offre payante, information que nous ne relayons pas ici faute de la tenir d’une source primaire à jour.
Ce que « 0 $ » signale sur l’économie des modèles ouverts
Un prix nul sur un comparateur d’API n’égale pas une informatique gratuite. Il traduit une propriété des modèles à poids ouverts : Alibaba publie les paramètres de Qwen, si bien qu’aucune redevance par token n’est due au producteur du modèle. Le champ « prix API » d’un agrégateur reflète le coût marginal facturé par le détenteur du modèle. Pour un modèle ouvert que vous exécutez vous-même, ce coût-là est effectivement zéro, puisqu’il n’existe pas de compteur côté éditeur.
La dépense, elle, ne s’évapore pas. Elle se déplace vers des lignes budgétaires que le comparateur n’affiche pas : le GPU loué à l’heure, la mémoire vive nécessaire pour charger 235 milliards de paramètres, la bande passante, le temps d’ingénieur pour maintenir le service, l’électricité. Un Qwen3 235B ne « coûte » rien à l’éditeur, mais son exécution mobilise une infrastructure dont la facture mensuelle peut dépasser celle d’une API propriétaire mesurée, selon le volume traité. Le zéro affiché est donc une invitation à faire soi-même le calcul complet — exactement ce que promettent les calculateurs de charge de CostPerPrompt.
Deux montants distincts se cachent d’ailleurs derrière le mot « prix » sur ce type d’outil. Le tarif d’entrée du prompt et le tarif du contexte ne sont pas toujours identiques : envoyer un prompt court et joindre un long historique conversationnel ne pèsent pas de la même manière. Sur les modèles ouverts listés à zéro côté prompt, la question du contexte se rejoue entièrement au niveau de l’infrastructure, puisque c’est la longueur traitée qui détermine la mémoire et le temps de calcul consommés. Le prix nul aplatit une réalité à deux vitesses.
Décoder la nomenclature : A22B, Thinking, VL, Coder
La gamme Qwen n’a de lisible que ce qu’on veut bien y déchiffrer, et sa nomenclature encode beaucoup d’informations. Prendre le temps de la lire évite de comparer des objets qui ne jouent pas dans la même catégorie, même quand ils partagent le prix de 0 $.
Le suffixe « A22B » d’un Qwen3 235B A22B indique une architecture à mélange d’experts : le modèle totalise 235 milliards de paramètres, mais n’en active qu’environ 22 milliards à chaque passage. Cette dissociation entre taille totale et paramètres actifs change tout côté exploitation. Un tel modèle demande la mémoire d’un géant pour être chargé, mais le coût de calcul par token se rapproche de celui d’un modèle bien plus petit. Le même principe régit le Qwen3 30B A3B (3 milliards actifs), le Qwen3 Coder 480B A35B (35 milliards actifs) ou le Qwen3 Next 80B A3B. À poids ouverts et prix affiché identique, ces modèles imposent des contraintes matérielles radicalement différentes.
Viennent ensuite les axes de spécialisation. « Instruct » désigne les versions alignées pour suivre des consignes en dialogue. « Thinking » signale des variantes optimisées pour le raisonnement en plusieurs étapes, qui consomment davantage de tokens de sortie en déroulant leur logique. « Coder » cible la génération et la compréhension de code. « VL », pour Vision-Language, traite l’image en plus du texte. Un Qwen3 VL 235B A22B Thinking cumule ainsi trois attributs : multimodal, très gros, orienté raisonnement.
La mention « 2507 » enfin, présente sur les Qwen3 235B A22B Instruct 2507 et Thinking 2507, marque une révision datée du modèle. Deux entrées voisines dans la liste ne sont donc pas des doublons mais des générations successives. Pour une équipe qui sélectionne un modèle, cette lecture fine prime sur le prix : entre un dense 32B et un MoE 235B A22B, le second offre davantage de capacité nominale mais réclame une empreinte mémoire sans commune mesure. Le comparateur donne le prix ; il ne donne pas cet arbitrage, qui reste à la charge de l’équipe.
Pour une équipe technique, le coût ne disparaît pas, il change de ligne budgétaire
L’intérêt d’un comparateur affichant des modèles ouverts à 0 $ n’est pas de promettre l’informatique gratuite, mais de rendre visible un choix d’architecture financière. Deux voies s’ouvrent à une direction technique française qui doit servir une charge intensive.
La première consiste à consommer une API propriétaire mesurée : le coût est prévisible au token, sans infrastructure à gérer, mais il croît linéairement avec le volume et échappe à tout contrôle une fois le service adopté. La seconde revient à héberger un modèle ouvert comme le Qwen3 Coder 480B A35B ou le Qwen2.5 VL 72B Instruct : la redevance par token tombe à zéro, mais un socle GPU fixe apparaît, amorti d’autant mieux que le volume est élevé. Le point de bascule entre ces deux modèles dépend entièrement du débit. En dessous d’un certain trafic, l’API mesurée reste plus économique malgré son prix unitaire ; au-delà, l’auto-hébergement d’un modèle à 0 $ affiché devient le choix rationnel.
C’est précisément le calcul qu’un outil de simulation par charge réelle permet de poser à plat, au lieu de le laisser à l’intuition. Une charge de résumé documentaire à faible volume, une charge de génération de code en continu sur une équipe de cinquante développeurs, une charge d’analyse d’images par lots : chacune déplace le point d’équilibre. Le prix affiché n’est que la première variable d’une équation où le débit, la longueur de contexte et la tolérance à la latence pèsent davantage.
Reste une dimension souveraine que le chiffre ne dit pas. Héberger un modèle ouvert, c’est aussi garder la donnée à l’intérieur d’un périmètre maîtrisé, argument dont le poids a crû pour les acteurs européens soumis à des exigences de localisation. Le 0 $ de Qwen agrège donc, sous un même chiffre, une logique de coût et une logique de contrôle.
Les angles morts du prix affiché
Un comparateur vaut par la qualité et l’actualité de sa base, et c’est là que la prudence s’impose. Un prix listé à 0 $ décrit ce que facture l’éditeur du modèle, pas ce que facturera l’hébergeur tiers qui, en pratique, sert souvent ces modèles ouverts via sa propre API mesurée. Un même Qwen3 peut ainsi apparaître à zéro chez son producteur et à un tarif non nul chez un fournisseur d’inference qui prend en charge l’exploitation. Le chiffre n’est vrai que dans le cadre exact où il est mesuré.
La granularité compte tout autant. Un tarif de prompt et un tarif de contexte peuvent diverger, et une comparaison qui ne retiendrait que la première colonne induirait en erreur sur des charges à long contexte. Les modèles « Thinking », qui produisent de longues chaînes de raisonnement, gonflent mécaniquement le volume de tokens de sortie : à prix unitaire égal, leur coût réel par requête dépasse celui d’une version « Instruct » plus directe. Le prix par token ne se lit jamais indépendamment du profil de la charge.
Enfin, un agrégateur reste tributaire de la date de sa dernière mise à jour. La valeur d’un tel projet se mesure sur la durée, à sa capacité à suivre des grilles qui changent sans préavis. Notre lecture : à sa sortie, CostPerPrompt rend un service réel en centralisant une information dispersée, à condition que l’utilisateur garde en tête ce que « 0 $ » recouvre et ne recouvre pas.
Ce que change un comparateur quand le token ne coûte plus rien
Le fait que des modèles de 235 ou 480 milliards de paramètres s’affichent à zéro déplace la nature même de l’avantage concurrentiel. Tant que le prix au token distinguait les offres, comparer revenait à lire une grille. Quand une partie du marché tombe à zéro affiché, la différence se joue ailleurs : dans le coût d’exploitation, la maîtrise de l’infrastructure, l’adéquation d’un modèle à une tâche précise. Un comparateur de prix devient alors, presque malgré lui, un comparateur d’architectures financières.
La question utile n’est plus « combien coûte ce token » mais « combien me coûte cette charge, chez moi, à mon débit ». Le champ de saisie du site le formule sans détour — « how much will this cost ». La réponse, elle, ne tient jamais dans une seule colonne : elle demande de croiser le prix affiché avec la mémoire, le débit et la longueur de contexte. C’est ce croisement, plus que le zéro lui-même, qui décide de la facture réelle.
Questions fréquentes
Le prix de 0 $ signifie-t-il que ces modèles Qwen sont vraiment gratuits à utiliser ?
Non. Le 0 $ affiché correspond à l’absence de redevance par token côté éditeur, propre aux modèles à poids ouverts. Les coûts d’exécution — GPU, mémoire, bande passante, exploitation — restent à votre charge dès que vous servez le modèle. Un fournisseur d’inference tiers peut en outre facturer sa propre API mesurée pour le même modèle.
Comment choisir entre un Qwen3 8B et un Qwen3 235B si les deux sont à 0 $ ?
Le prix ne départage rien ici ; la décision se joue sur la capacité et les contraintes matérielles. Le 235B A22B offre davantage de puissance nominale mais exige la mémoire pour charger 235 milliards de paramètres, quand le 8B tient sur un socle bien plus modeste. On arbitre selon la complexité de la tâche, la longueur de contexte visée et le budget d’infrastructure disponible.
À quoi servent les calculateurs de coût par charge de CostPerPrompt ?
Ils traduisent un prix au token en dépense estimée pour un usage concret, en fonction du volume et du profil de la charge. C’est l’outil qui rend comparable une API propriétaire mesurée et un modèle ouvert affiché à zéro, en révélant le point de débit au-delà duquel l’auto-hébergement devient plus économique.
Sources – CostPerPrompt — Live AI API Pricing & LLM Cost Calculators (consulté le 2 août 2026) : grille de prix au million de tokens, liste des modèles Alibaba (Qwen2.5 et Qwen3) affichés à 0 $, calculateurs de coût par charge, citation du champ « how much will this cost ».
À lire aussi sur LagazetteIA : notre comparatif des modèles à poids ouverts, le coût réel de l’inference en production, MoE et paramètres actifs, ce qu’il faut comprendre, la stratégie IA d’Alibaba avec Qwen.



