Mes lectures 0

Mes lectures

Outils IA

Open d1 : des modèles de décision multimodaux pour le edge, promesses et angles morts

Liquid AI publie open d1, des modèles de décision multimodaux ouverts pensés pour le edge, avec un score annoncé de 48,57 pour d1-3B. Apports, contexte des modèles ouverts récents et limites à vérifier avant tout déploiement local.

Boîtier edge en métal brossé avec caméra et micro sur un établi en bois dans un atelier industriel

Les modèles d’IA ne se contentent plus de générer du texte : une nouvelle famille, dite « de décision », vise à trancher entre plusieurs options à partir d’images, d’audio ou de texte, directement sur des appareils locaux. Le 7 octobre 2026, Liquid AI a publié sur Hugging Face sa gamme open d1, présentée comme des modèles de décision multimodaux conçus pour le edge S1. Cet article résume ce que l’éditeur annonce, le replace dans le paysage des modèles ouverts récents et signale ce qu’il reste à vérifier avant tout déploiement.

Ce que Liquid AI annonce avec open d1

Le modèle phare, d1-3B, obtient un score de 48,57 sur le Decision Index 0.2.1, un indice où il devance, selon l’éditeur, tous les modèles de 4B et de 9B, ainsi que Decider 35B-A3B crédité de 47,11 S1. L’argument central est donc le rapport taille/performance : un modèle d’environ 3 milliards de paramètres rivaliserait avec des architectures bien plus lourdes, ce qui compte lorsque la mémoire et l’énergie d’un appareil embarqué sont limitées.

Sur le volet multimodal, d1-3B accepte le texte et les images, tandis que d1-omni-600M, encore plus compact, gère soit texte et images, soit texte et audio S1. Cette séparation en deux variantes suggère une logique de déploiement par cas d’usage : un capteur visuel d’un côté, une interface vocale de l’autre.

Il faut toutefois rappeler une limite de lecture essentielle : ces chiffres proviennent du billet de l’éditeur et non d’une évaluation indépendante. Le Decision Index 0.2.1 n’est pas documenté dans les éléments fournis ici, et un indice en version 0.2.1 signale lui-même une méthodologie encore jeune.

Un mouvement plus large vers des modèles ouverts et spécialisés

Open d1 s’inscrit dans une tendance où des laboratoires publient des modèles ouverts taillés pour une tâche précise plutôt que pour tout faire. Le 2 octobre, Ai2 a ainsi ouvert AstaBrief 8B, un modèle qui transforme une question de recherche et des extraits de littérature en rapport cité, utilisé dans la fonction de génération de rapports d’Asta S2. Son mode rapide produit un rapport en 51,1 secondes en moyenne, contre 178,5 secondes pour le mode réflexion, soit un gain d’environ 3,5 fois, toujours d’après l’éditeur S2. Le parallèle est instructif : dans les deux cas, la spécialisation sert à réduire latence et coût, pas à battre les généralistes sur tout.

Côté modèles généralistes servis dans le cloud, le catalogue des fournisseurs d’inférence de Hugging Face liste par exemple Qwen3.8-27B à 0,42 $ en entrée et 3,00 $ en sortie, et DeepSeek-V4.1-Flash avec une fenêtre de contexte de 1 048 576 tokens S3. Ces chiffres donnent un ordre de grandeur de ce que coûte l’alternative hébergée face à un modèle local comme d1-3B, sans que les deux approches soient directement comparables. Pour situer ces références, notre dossier sur Models.dev cartographie les modèles ouverts disponibles.

Tableau de lecture

ModèleTailleModalitésDonnée cléSource
d1-3B3Btexte, images48,57 au Decision Index 0.2.1S1
d1-omni-600M600Mtexte + images ou texte + audiovariante compacteS1
AstaBrief 8B8Btexte51,1 s par rapport en mode rapideS2
DeepSeek-V4.1-Flashn.c.n.c.contexte de 1 048 576 tokensS3

Limites concrètes et ce que le lecteur peut faire

Exemple fictif pour fixer les idées : une PME imagine installer d1-omni-600M sur un boîtier en atelier pour signaler, à partir d’un flux audio, qu’une machine présente un bruit anormal. Rien dans les sources ne prouve que le modèle convient à ce type de tâche : la multimodalité audio est annoncée, pas la fiabilité sur un domaine industriel précis S1. Avant d’y croire, cette entreprise devrait constituer son propre jeu de test et comparer le modèle à une solution plus simple.

Plus généralement, trois réserves s’imposent. D’abord, le score de 48,57 n’a de sens que si l’indice correspond à vos décisions réelles ; un benchmark de l’éditeur ne remplace pas un essai sur vos données S1. Ensuite, le gain de vitesse d’un modèle spécialisé, comme les 3,5 fois d’AstaBrief, s’accompagne généralement d’un périmètre plus étroit, à évaluer honnêtement S2. Enfin, le choix entre edge et cloud dépend aussi des coûts d’inférence hébergée et de la taille de contexte nécessaire, deux paramètres que les catalogues publics permettent d’estimer S3.

Action utile : téléchargez d1-3B ou d1-omni-600M, mesurez la latence et la mémoire sur votre matériel cible, puis confrontez les sorties à une centaine de cas annotés par vos soins. Pour une méthode de test comparable sur un modèle multimodal local, voir notre test de Qwen 3.5 Small. La nouveauté d’open d1 est réelle sur le papier ; sa valeur pour vous reste à démontrer.

Sources consultées

  1. Multimodal open d1 decision models for the edge
  2. Open-sourcing AstaBrief, the fast report-generation model in Asta
  3. Hugging Face Inference Providers · Supported Models
Sources
Avatar photo
Transparence

Rédigé avec l'assistance d'outils d'IA générative à partir de sources primaires identifiées, puis vérifié et validé par Mohamed Meguedmi, fondateur et directeur éditorial de LaGazetteIA. Charte éditoriale · Tous ses articles