- ▸ Une passerelle unique devant chaque fournisseur vocal
- ▸ GPT-4o Transcribe à 0,0010 $/min, six fois moins que la version mini
- ▸ Ce que représente l'écart à l'échelle
- ▸ Compatible avec l'API d'OpenAI, un simple changement de hostname
Le service, issu de la promotion S26 de Y Combinator, place plusieurs moteurs de reconnaissance vocale derrière une seule API. Objectif affiché : comparer qualité et coût sans changer de code, là où chaque fournisseur imposait jusqu’ici son propre point d’accès.
L’essentiel – Une API et une clé uniques donnent accès à plusieurs moteurs de transcription, selon Speko. – Deux tarifs publiés à ce jour : GPT-4o Transcribe à 0,0010 $/min, GPT-4o-mini Transcribe à 0,0060 $/min, soit six fois plus cher. – Compatibilité avec l’API d’OpenAI : changer le hostname et le nom du modèle suffit pour brancher un framework existant.
Une passerelle unique devant chaque fournisseur vocal
Speko se présente comme une passerelle (gateway) : une seule URL de base et une seule clé placées devant tous les fournisseurs. Le principe reprend celui d’OpenRouter, l’agrégateur qui centralise les API de modèles de langage, transposé ici à la reconnaissance vocale (ASR, la transcription automatique de la parole).
Chaque moteur est mesuré langue par langue, puis raccordé à cette API commune, indique Speko sur sa page d’accueil. Le développeur interroge un catalogue au lieu de signer un contrat distinct avec chaque éditeur. Il choisit son modèle selon la langue et l’objectif, pas selon un classement maison imposé par un vendeur.
GPT-4o Transcribe à 0,0010 $/min, six fois moins que la version mini
Deux références sont chiffrées à ce jour sur le comparateur.
| Modèle | Taux d’erreur | Coût par minute |
|---|---|---|
| GPT-4o Transcribe | 4 % | 0,0010 $ |
| GPT-4o-mini Transcribe | 3 % | 0,0060 $ |
Source : Speko, données relevées en 2026.
L’écart de prix étonne. La version mini affiche un taux d’erreur plus bas — 3 % contre 4 % — mais un coût six fois supérieur : 0,0060 $ contre 0,0010 $ la minute.
Ce que représente l’écart à l’échelle
Rapporté au volume, le calcul devient concret. Pour 10 000 minutes transcrites, soit environ 166 heures d’audio, GPT-4o Transcribe revient à 10 $, sa déclinaison mini à 60 $. Sur un centre d’appels traitant des dizaines de milliers de minutes par mois, l’arbitrage entre 4 % et 3 % d’erreur se paie donc en dizaines de dollars par tranche. C’est ce type de comparaison que Speko met en avant : le moins précis n’est pas toujours le moins cher, et inversement.
Compatible avec l’API d’OpenAI, un simple changement de hostname
Speko parle le même langage que l’API d’OpenAI. Les frameworks déjà en production n’ont besoin que d’un hostname et d’une chaîne de caractères désignant le modèle, selon Speko. Un agent bâti sur LiveKit se rebranche en modifiant l’adresse et le nom du modèle, sans réécrire la logique applicative.
Cette compatibilité réduit le coût de migration. Une équipe qui utilise déjà la bibliothèque officielle d’OpenAI conserve son code et bascule le trafic vers Speko en pointant vers une nouvelle URL de base.
Un positionnement d’intermédiaire, pas de nouveau modèle
Speko ne publie pas son propre moteur. Il se place entre le développeur et les éditeurs existants, et vend la comparaison plutôt que la performance brute — à l’image de la logique d’agrégation déjà éprouvée côté LLM et des places de marché de modèles. L’argument tient si les mesures restent lisibles et indépendantes des fournisseurs. Sur un marché où chaque éditeur revendique le meilleur score, un tiers qui benchmarke langue par langue occupe une position utile, à condition de tenir la neutralité dans la durée.
Questions fréquentes
Faut-il réécrire son code pour passer par Speko ?
Non, selon Speko. Le service reproduit l’API d’OpenAI : une équipe modifie l’URL de base et le nom du modèle, puis conserve le reste de son intégration. Les frameworks courants, comme LiveKit, se rebranchent avec ces deux paramètres.
Sur quoi repose le choix du modèle ?
Sur des mesures publiées langue par langue, pas sur un classement unique fourni par un vendeur. Le développeur sélectionne le moteur en fonction de la langue traitée et de son objectif de coût ou de précision.
Prochaines étapes
Reste à connaître le catalogue complet et la grille tarifaire au-delà des deux modèles chiffrés ce jour. La cohérence des benchmarks dans le temps déterminera la crédibilité du service. À lire aussi : notre panorama des API de reconnaissance vocale.



