Mes lectures 0

Mes lectures

IA Générale

Speko lance son routeur voix IA : GPT-4o à 0,0010 $/min

Le service, issu de la promotion S26 de Y Combinator, place plusieurs moteurs de reconnaissance vocale derrière une seule API. Objectif affiché : comparer

Baie de brassage audio en acier brossé reliée par des câbles de cuivre, dans un studio sombre.
📋 En bref
Le service, issu de la promotion S26 de Y Combinator, place plusieurs moteurs de reconnaissance vocale derrière une seule API. Objectif affiché : comparer
  • Une passerelle unique devant chaque fournisseur vocal
  • GPT-4o Transcribe à 0,0010 $/min, six fois moins que la version mini
  • Ce que représente l'écart à l'échelle
  • Compatible avec l'API d'OpenAI, un simple changement de hostname

Le service, issu de la promotion S26 de Y Combinator, place plusieurs moteurs de reconnaissance vocale derrière une seule API. Objectif affiché : comparer qualité et coût sans changer de code, là où chaque fournisseur imposait jusqu’ici son propre point d’accès.

🤖 Transparence IA — Cet article a été rédigé avec l'assistance d'outils d'IA générative à partir de sources primaires identifiées, puis relu et validé par Mohamed Meguedmi, fondateur de LagazetteIA.

L’essentiel – Une API et une clé uniques donnent accès à plusieurs moteurs de transcription, selon Speko. – Deux tarifs publiés à ce jour : GPT-4o Transcribe à 0,0010 $/min, GPT-4o-mini Transcribe à 0,0060 $/min, soit six fois plus cher. – Compatibilité avec l’API d’OpenAI : changer le hostname et le nom du modèle suffit pour brancher un framework existant.

Une passerelle unique devant chaque fournisseur vocal

Speko se présente comme une passerelle (gateway) : une seule URL de base et une seule clé placées devant tous les fournisseurs. Le principe reprend celui d’OpenRouter, l’agrégateur qui centralise les API de modèles de langage, transposé ici à la reconnaissance vocale (ASR, la transcription automatique de la parole).

Chaque moteur est mesuré langue par langue, puis raccordé à cette API commune, indique Speko sur sa page d’accueil. Le développeur interroge un catalogue au lieu de signer un contrat distinct avec chaque éditeur. Il choisit son modèle selon la langue et l’objectif, pas selon un classement maison imposé par un vendeur.

GPT-4o Transcribe à 0,0010 $/min, six fois moins que la version mini

Deux références sont chiffrées à ce jour sur le comparateur.

ModèleTaux d’erreurCoût par minute
GPT-4o Transcribe4 %0,0010 $
GPT-4o-mini Transcribe3 %0,0060 $

Source : Speko, données relevées en 2026.

L’écart de prix étonne. La version mini affiche un taux d’erreur plus bas — 3 % contre 4 % — mais un coût six fois supérieur : 0,0060 $ contre 0,0010 $ la minute.

Ce que représente l’écart à l’échelle

Rapporté au volume, le calcul devient concret. Pour 10 000 minutes transcrites, soit environ 166 heures d’audio, GPT-4o Transcribe revient à 10 $, sa déclinaison mini à 60 $. Sur un centre d’appels traitant des dizaines de milliers de minutes par mois, l’arbitrage entre 4 % et 3 % d’erreur se paie donc en dizaines de dollars par tranche. C’est ce type de comparaison que Speko met en avant : le moins précis n’est pas toujours le moins cher, et inversement.

Compatible avec l’API d’OpenAI, un simple changement de hostname

Speko parle le même langage que l’API d’OpenAI. Les frameworks déjà en production n’ont besoin que d’un hostname et d’une chaîne de caractères désignant le modèle, selon Speko. Un agent bâti sur LiveKit se rebranche en modifiant l’adresse et le nom du modèle, sans réécrire la logique applicative.

Cette compatibilité réduit le coût de migration. Une équipe qui utilise déjà la bibliothèque officielle d’OpenAI conserve son code et bascule le trafic vers Speko en pointant vers une nouvelle URL de base.

Un positionnement d’intermédiaire, pas de nouveau modèle

Speko ne publie pas son propre moteur. Il se place entre le développeur et les éditeurs existants, et vend la comparaison plutôt que la performance brute — à l’image de la logique d’agrégation déjà éprouvée côté LLM et des places de marché de modèles. L’argument tient si les mesures restent lisibles et indépendantes des fournisseurs. Sur un marché où chaque éditeur revendique le meilleur score, un tiers qui benchmarke langue par langue occupe une position utile, à condition de tenir la neutralité dans la durée.

Questions fréquentes

Faut-il réécrire son code pour passer par Speko ?

Non, selon Speko. Le service reproduit l’API d’OpenAI : une équipe modifie l’URL de base et le nom du modèle, puis conserve le reste de son intégration. Les frameworks courants, comme LiveKit, se rebranchent avec ces deux paramètres.

Sur quoi repose le choix du modèle ?

Sur des mesures publiées langue par langue, pas sur un classement unique fourni par un vendeur. Le développeur sélectionne le moteur en fonction de la langue traitée et de son objectif de coût ou de précision.

Prochaines étapes

Reste à connaître le catalogue complet et la grille tarifaire au-delà des deux modèles chiffrés ce jour. La cohérence des benchmarks dans le temps déterminera la crédibilité du service. À lire aussi : notre panorama des API de reconnaissance vocale.

Avatar photo
À propos de l'auteur

Mohamed Meguedmi

Je suis Mohamed Meguedmi, fondateur et directeur éditorial de LagazetteIA. Multi-entrepreneur passionné de tech depuis toujours, j'ai intégré l'IA dans chacune de mes entreprises dès ses débuts. Chaque semaine, je teste des dizaines d'outils IA, compare les modèles et décortique les dernières avancées pour vous donner un avis concret, sans bullshit. Mon objectif avec LagazetteIA : vous faire gagner du temps et vous aider à prendre les bonnes décisions dans cette révolution technologique. La rédaction s'appuie sur des outils d'analyse modernes (incluant l'IA générative) et chaque publication est vérifiée et validée par mes soins avant mise en ligne. Profil LinkedIn : https://www.linkedin.com/in/mohamed-meguedmi/