Les modèles d’IA ne se contentent plus de générer du texte : une nouvelle famille, dite « de décision », vise à trancher entre plusieurs options à partir d’images, d’audio ou de texte, directement sur des appareils locaux. Le 7 octobre 2026, Liquid AI a publié sur Hugging Face sa gamme open d1, présentée comme des modèles de décision multimodaux conçus pour le edge S1. Cet article résume ce que l’éditeur annonce, le replace dans le paysage des modèles ouverts récents et signale ce qu’il reste à vérifier avant tout déploiement.
Ce que Liquid AI annonce avec open d1
Le modèle phare, d1-3B, obtient un score de 48,57 sur le Decision Index 0.2.1, un indice où il devance, selon l’éditeur, tous les modèles de 4B et de 9B, ainsi que Decider 35B-A3B crédité de 47,11 S1. L’argument central est donc le rapport taille/performance : un modèle d’environ 3 milliards de paramètres rivaliserait avec des architectures bien plus lourdes, ce qui compte lorsque la mémoire et l’énergie d’un appareil embarqué sont limitées.
Sur le volet multimodal, d1-3B accepte le texte et les images, tandis que d1-omni-600M, encore plus compact, gère soit texte et images, soit texte et audio S1. Cette séparation en deux variantes suggère une logique de déploiement par cas d’usage : un capteur visuel d’un côté, une interface vocale de l’autre.
Il faut toutefois rappeler une limite de lecture essentielle : ces chiffres proviennent du billet de l’éditeur et non d’une évaluation indépendante. Le Decision Index 0.2.1 n’est pas documenté dans les éléments fournis ici, et un indice en version 0.2.1 signale lui-même une méthodologie encore jeune.
Un mouvement plus large vers des modèles ouverts et spécialisés
Open d1 s’inscrit dans une tendance où des laboratoires publient des modèles ouverts taillés pour une tâche précise plutôt que pour tout faire. Le 2 octobre, Ai2 a ainsi ouvert AstaBrief 8B, un modèle qui transforme une question de recherche et des extraits de littérature en rapport cité, utilisé dans la fonction de génération de rapports d’Asta S2. Son mode rapide produit un rapport en 51,1 secondes en moyenne, contre 178,5 secondes pour le mode réflexion, soit un gain d’environ 3,5 fois, toujours d’après l’éditeur S2. Le parallèle est instructif : dans les deux cas, la spécialisation sert à réduire latence et coût, pas à battre les généralistes sur tout.
Côté modèles généralistes servis dans le cloud, le catalogue des fournisseurs d’inférence de Hugging Face liste par exemple Qwen3.8-27B à 0,42 $ en entrée et 3,00 $ en sortie, et DeepSeek-V4.1-Flash avec une fenêtre de contexte de 1 048 576 tokens S3. Ces chiffres donnent un ordre de grandeur de ce que coûte l’alternative hébergée face à un modèle local comme d1-3B, sans que les deux approches soient directement comparables. Pour situer ces références, notre dossier sur Models.dev cartographie les modèles ouverts disponibles.
Tableau de lecture
| Modèle | Taille | Modalités | Donnée clé | Source |
|---|---|---|---|---|
| d1-3B | 3B | texte, images | 48,57 au Decision Index 0.2.1 | S1 |
| d1-omni-600M | 600M | texte + images ou texte + audio | variante compacte | S1 |
| AstaBrief 8B | 8B | texte | 51,1 s par rapport en mode rapide | S2 |
| DeepSeek-V4.1-Flash | n.c. | n.c. | contexte de 1 048 576 tokens | S3 |
Limites concrètes et ce que le lecteur peut faire
Exemple fictif pour fixer les idées : une PME imagine installer d1-omni-600M sur un boîtier en atelier pour signaler, à partir d’un flux audio, qu’une machine présente un bruit anormal. Rien dans les sources ne prouve que le modèle convient à ce type de tâche : la multimodalité audio est annoncée, pas la fiabilité sur un domaine industriel précis S1. Avant d’y croire, cette entreprise devrait constituer son propre jeu de test et comparer le modèle à une solution plus simple.
Plus généralement, trois réserves s’imposent. D’abord, le score de 48,57 n’a de sens que si l’indice correspond à vos décisions réelles ; un benchmark de l’éditeur ne remplace pas un essai sur vos données S1. Ensuite, le gain de vitesse d’un modèle spécialisé, comme les 3,5 fois d’AstaBrief, s’accompagne généralement d’un périmètre plus étroit, à évaluer honnêtement S2. Enfin, le choix entre edge et cloud dépend aussi des coûts d’inférence hébergée et de la taille de contexte nécessaire, deux paramètres que les catalogues publics permettent d’estimer S3.
Action utile : téléchargez d1-3B ou d1-omni-600M, mesurez la latence et la mémoire sur votre matériel cible, puis confrontez les sorties à une centaine de cas annotés par vos soins. Pour une méthode de test comparable sur un modèle multimodal local, voir notre test de Qwen 3.5 Small. La nouveauté d’open d1 est réelle sur le papier ; sa valeur pour vous reste à démontrer.
Sources consultées
- Multimodal open d1 decision models for the edge
- Open-sourcing AstaBrief, the fast report-generation model in Asta
- Hugging Face Inference Providers · Supported Models
- huggingface.co — huggingface.co
