Tout le monde lance désormais un « routeur de modèles ». Runway vient d’en publier un pour les médias génératifs alors que le marché se remplit de modèles vidéo et image ; Anthropic a livré des modèles de mode voix plus capables ; les prétendants open‑weight atteignent une qualité de niveau Fable pour un tiers du coût. Les routeurs promettent automatiquement le meilleur modèle pour chaque requête. Problème : laissés en boîte noire, les routeurs routent mal vos cas difficiles, font exploser la facture de réessais et endorment votre équipe avec une fausse confiance.
Si vous voulez le vrai gain — 30 à 50 % de dépenses IA en moins à qualité égale ou supérieure — il faut faire de la politique de routage un composant de première classe de votre plateforme, pas un simple interrupteur chez un fournisseur. Ce billet propose le cadre de décision que j’aimerais voir plus de CTO utiliser avant de brancher leur produit à une boîte noire.
Pourquoi les routeurs comptent maintenant (et pourquoi ils échouent par défaut)
Trois choses ont changé en 2026 :
- Prolifération des modèles : Vous ne choisissez plus entre deux LLM de pointe. Vous choisissez parmi des dizaines de modèles spécialisés texte, code, image et vidéo (Flux 3, modèles d’action/vidéo type Mimic, modèles à poids ouverts adaptés au domaine) avec des fenêtres de contexte, des courbes de prix et des modes de défaillance très différents.
- Parité des poids ouverts sur des tâches étroites : Les modèles à poids ouverts atteignent désormais 80–95 % des performances de pointe sur des tâches bien circonscrites pour 30–60 % du coût. Vous ne pouvez plus vous permettre de tout mettre en premium.
- Modalités temps réel : La voix et la vidéo exigent des budgets de latence serrés et des profils d’erreur différents du chat. Un repli « lent mais malin » qui sauve les flux texte peut ruiner votre NPS s’il ajoute 800 ms à un tour de voix.
Les fournisseurs répondent avec des routeurs. Très bien. Mais un routeur générique ne peut pas connaître vos SLO par client, votre posture de conformité ni vos plafonds de coûts. Résultat prévisible : beaucoup de routage « magique » qui paraît astucieux en démo et brûle de l’argent en production.
L’économie : le coût par réussite, pas le coût par 1 000 tokens
Voici l’unique métrique qui compte à la frontière du routeur :
Coût effectif par tâche réussie = (coût API + coût infra + réessais + replis) / taux de réussite
Deux implications :
- Un modèle « moins cher » qui nécessite en moyenne 1,6 réessai est souvent plus coûteux qu’un modèle « plus onéreux » avec un meilleur taux de réussite au premier coup.
- La qualité du routage compte autant que le prix du modèle. Un gain de 10 points en réussite au premier passage peut réduire le coût effectif de 20–30 % sans toucher à vos contrats fournisseurs.
Chiffres observés chez des clients ces 9 derniers mois :
- Flux d’assistance texte : Faire passer 65–80 % des requêtes vers un modèle à poids ouverts affiné avec un repli vers un modèle de pointe à 5–10 % a produit 28–42 % de réduction de coût avec des scores de satisfaction stables.
- Voix/ASR : ASR sur appareil ou en périphérie pour les appels à faible bruit pour maintenir le p50 sous 200 ms ; ASR cloud uniquement lors de détection de fort bruit. Bilan : facture en baisse de 25–40 % et moins d’interruptions (barge‑ins) en SVI.
- Pipelines vidéo : Sélection de frames légère + sous‑titres sur poids ouverts pour 85 % des clips ; modèle premium uniquement quand la complexité de mouvement/action dépasse un seuil. Résultat : 35–55 % de baisse de coût pour une qualité éditoriale comparable.
La pile de routage en quatre couches dont vous avez réellement besoin
1) Couche politique : encoder la réalité métier
Définissez une politique explicite qui transforme les contraintes métier en entrées de routage. A minima, chaque requête doit arriver avec :
- Budget de latence : cibles p50/p95 en ms (ex. 250/600 ms pour les tours de voix ; 800/2000 ms pour les étapes de chat).
- Plafond de coût : limites par requête et par client (ex. 0,06 $ max pour une étape de chat sur l’offre standard).
- Niveau de qualité : bandes de risque acceptables (ex. « brouillon OK », « doit être production‑grade », « revue juridique »).
- Modèle et indicateurs de complexité : tokens estimés, langue, toxicité, présence de PII, SNR audio, score de mouvement vidéo, entropie de prompt, indicateurs code/outillage.
- Contexte de conformité : juridiction (US/EU/BR), contraintes de résidence des données, drapeaux de consentement client.
- Segment client : gratuit/standard/pro ; les SLA diffèrent.
Mettez ces attributs dans un RequestEnvelope. Sérialisez‑le (Protobuf/Cap’n Proto) et transmettez‑le avec chaque appel. Si votre routeur ne peut pas lire l’enveloppe, il ne peut pas servir le métier.
2) Couche décision : règles d’abord, apprentissage ensuite
Commencez par des règles déterministes ; passez à des sélecteurs appris une fois que vous avez des données.
- Base de règles : Si SNR audio > 20 dB et langue ∈ {en, es, pt} alors ASR=open_weight_v3 ; sinon ASR=premium_realtime. Si tokens estimés > 12k alors LLM=long_context ; sinon LLM=cheap_tuned. Si PII=true et region=EU alors router vers eu_guarded_model.
- Champion‑challenger : Choisissez un défaut (champion) et mettez 5–15 % du trafic en shadow vers un challenger. Comparez réussite/latence/coût ; ne promouvez qu’en cas de gain statistiquement significatif.
- Interrupteurs d’arrêt (kill switches) : Basculement par modèle et par fournisseur avec TTL. Quand un vendor se dégrade en silence, vous changez en minutes, pas en jours.
- Arbres de repli : Pré‑calculez un chemin de repli en 2 étapes par type de tâche. Des replis aléatoires créent le chaos ; des replis planifiés réduisent les réessais et la latence de queue.
- Sensibilité aux taux/quotas : Quotas temps réel par modèle/fournisseur pour éviter les « thundering herds » et les emails d’urgence des vendors.
Après 4–6 semaines, entraînez un sélecteur qui prédit la probabilité de réussite par modèle à partir des attributs de votre enveloppe. Gardez le modèle petit (régression logistique/XGBoost) et rapide. L’API de décision doit renvoyer : modèle cible, confiance et variables d’explication pour l’audit.
3) Couche exécution : adaptateurs rapides et caches
La décision ne vaut rien si les adaptateurs coincent. Traitez le routeur comme un service mesh pour l’IA :
- Adaptateurs : Normalisez les schémas d’appels d’outils, les protocoles de streaming (SSE/gRPC) et les codes d’erreur. La parité des tokenizers compte ; des divergences font exploser vos estimations de tokens.
- Cache : Dédupliquez les prompts fréquents ; mettez en cache les embeddings et retranscriptions pour des entrées identiques avec des TTL courts. Pour les médias, mettez en cache les étapes intermédiaires (ex. keyframes, transcriptions).
- Concurrence et backpressure : Le p99 de queue tue l’UX. Utilisez des files et des plafonds de concurrence par modèle ; éliminez tôt quand vous ne pouvez pas tenir les SLO.
- Pré‑chauffe : Maintenez un pool minimal chaud pour les endpoints sujets au cold start (en particulier sockets temps réel/voix/vidéo).
4) Observabilité et comptabilité : un registre des coûts, sinon ça n’existe pas
Instrumentez le routeur avec un registre de premier ordre :
- Par requête : modèle utilisé, latence par étape, tokens in/out, coût API, estimation de coût infra, hits de cache, réessais, chemin de repli, indicateur de succès et issue finale de la tâche.
- Par client/segment/région : coût moyen par réussite, atteinte des SLO et alertes d’anomalie.
- Métriques de trafic shadow : gain/régression du challenger avec analyse de puissance pour éviter de promouvoir du bruit.
Si votre DAF ne peut pas passer de « 412 k$ ce mois‑ci » à « 0,032 $ par réussite pour le chat Standard en us‑east », vous ne maîtrisez pas votre coût IA.
Sur quoi router : des signaux qui font vraiment la différence
- Longueur/complexité : Tokens estimés (pré‑tokenisation), entropie des phrases, code vs prose, présence de tableaux/listes. Routez les longs contextes vers des modèles au pricing long‑contexte économique et à bonne capacité de rappel.
- Langue/dialecte : Distinguez explicitement pt‑BR de pt‑PT ; la différence compte pour l’ASR et le ton.
- Qualité audio : SNR, trous VAD, chevauchement ; routez l’audio propre vers l’ASR local/périphérie.
- Mouvement/action vidéo : Des scores simples de différence de frames et d’optical‑flow séparent le « talking head » des « highlights de foot ». N’utilisez le premium que quand la reconnaissance d’action est critique.
- Safety/conformité : Détection de PII, drapeaux PHI (si « ChatGPT Health » vous tente), contrôles d’export pour contenu sensible et résidence géographique.
- Segment client et état produit : Les offres gratuites ont des défauts plus économiques ; le « mode legal » force un routage conservateur et des étapes de vérification supplémentaires.
Exemples concrets : comment le routage réduit les coûts sans dégrader la qualité
1) Copilote de support (texte + outils)
Baseline : LLM de pointe pour tout. p50 900 ms, 0,09 $ par étape, 72 % de résolution au premier passage.
Politique de routage :
- Étapes « outils uniquement » (pas de génération) → petit modèle orienté function‑calling.
- Intents FAQ → poids ouverts affinés avec retrieval ; repli vers un modèle de pointe en cas de faible confiance.
- Parcours remboursement/crédit → modèle de pointe avec schéma d’outils plus strict et audit.
Résultat après 6 semaines : 34 % de réduction de coût, p50 710 ms, résolution au premier passage 74 % (gain de 2 points). Aucune régression visible côté utilisateur.
2) Assistant vocal
Baseline : ASR cloud et LLM de pointe. Barge‑ins fréquents ; les utilisateurs se plaignent de la latence.
Politique de routage :
- ASR : Si SNR > 20 dB et langue ∈ {en, es, pt‑BR} → ASR sur appareil/périphérie ; sinon premium cloud.
- LLM : Si budget par tour < 250 ms p50 → petit modèle temps réel ; n’escalader vers un plus gros modèle que pour les tours de confirmation/résumé.
Résultat : latence p50 par tour 180 ms (contre 480 ms), coût par minute en baisse de 38 %, moins d’interruptions, même taux de réussite des tâches.
3) Outil de clipping vidéo pour UGC
Baseline : Modèle de vision de pointe pour la sélection de plans, le sous‑titrage et la vignette. Qualité forte, facture rude.
Politique de routage :
- Détection de plans + sélection de keyframes avec CV open‑weight + heuristiques simples de mouvement.
- Sous‑titres avec modèle à poids ouverts ; modèle de pointe utilisé uniquement quand le score d’action > seuil.
- Génération de vignettes avec diffusion à poids ouverts ; modèle de pointe réservé aux marques/tier premium.
Résultat : 51 % de réduction de coût, taux d’acceptation éditeur inchangé.
Construire vs acheter : quand un routeur fournisseur aide — et quand il vous pénalise
Le routeur de modèles de Runway a du sens si votre charge est très axée média et que vous acceptez leurs signaux et valeurs par défaut. Mais acheteurs, attention :
- Politique opaque : Si vous ne pouvez pas encoder le segment, la juridiction ou les plafonds de coûts, vous allez mal router.
- Pas de registre, pas de confiance : Si le fournisseur ne peut pas fournir un registre par requête, vous ne pouvez pas vérifier les économies ni la qualité.
- Modalités limitées : Un routeur média n’aidera pas votre outil code ou votre agent back‑office.
- Conflits de garde‑fous : Si le routeur impose des filtres de safety qui bloquent de la recherche ou du debug légitime (sujet d’actualité en sécurité offensive), vous avez besoin d’une voie de contournement et d’un audit.
Ma règle : achetez les adaptateurs et les harnais d’évaluation ; construisez la politique et la logique de décision. C’est la seule pièce intimement liée à vos contraintes métier.
Plan de mise en œuvre (90 jours)
Jours 0–30 : Baseline et enveloppe
- Instrumentation : Ajoutez coût, tokens, latence et métriques de réussite par requête sur votre pile mono‑modèle actuelle.
- Enveloppe : Définissez le RequestEnvelope et renseignez les attributs clés (longueur, langue, SNR, PII, segment, région).
- Adaptateurs : Normalisez deux fournisseurs avec du streaming et une gestion d’erreurs cohérents.
Jours 31–60 : Règles et champion‑challenger
- Règles v1 : Encodez 4–6 règles à fort effet de levier pour vos flux principaux.
- Shadowing : Routez 10 % du trafic vers un challenger ; stockez sorties et métriques côte à côte.
- Replis : Pré‑définissez un repli en 2 étapes par flux ; ajoutez des kill switches avec TTL.
Jours 61–90 : Sélection apprise et gouvernance
- Sélecteur v1 : Entraînez un petit modèle pour prédire la réussite au premier passage par candidat ; utilisez les règles comme garde‑fous et le sélecteur pour départager.
- Gouvernance : Créez un processus d’approbation des changements : le Produit fixe les bandes de qualité et SLO de latence ; la Finance fixe les plafonds budgétaires ; la Plateforme gère promotion/rétrogradation avec preuves issues du registre.
- Dashboards : Coût par réussite par segment/flux/région ; atteinte des SLO ; alertes de dérive ; performance du challenger avec valeurs p.
Modes d’échec et comment les éviter
- Cold starts qui explosent votre p95 : Réchauffez un pool minimal pour les endpoints temps réel ; routez les hits à froid vers des modèles avec handshake plus rapide.
- Dérive d’estimation de tokens : Maintenez la parité des tokenizers ; ré‑estimez après changements de templates de prompt ; cappez les contextes pour éviter les surprises de « taxe long‑contexte ».
- Casse due à la quantification/appels d’outils : Des modèles open‑weight quantifiés peuvent halluciner les schémas d’outils. Gardez les appels d’outils sur des modèles que vous avez validés pour cette fonction ; ajoutez des validateurs de schéma.
- Murs de quota : Suivez les limites de taux des fournisseurs et la concurrence E2E. Re‑routez de manière préemptive avant de heurter un mur ; ne le découvrez pas lundi 10 h.
- Sur‑blocage de safety : Offrez un mode recherche/diagnostic avec privilèges élevés, données cloisonnées et traces d’audit immuables. Ne laissez pas les garde‑fous paralyser vos ingénieurs.
Organisation : qui possède le routage ?
Confiez le routage à l’équipe Plateforme, en lien pointillé avec Finance et Produit. La Plateforme implémente enveloppes, adaptateurs et logique de décision ; la Finance fixe les plafonds budgétaires et audite le registre ; le Produit définit les bandes de qualité spécifiques aux tâches et les cibles de latence. Traitez les changements de routage comme des changements d’infra : feature‑flag, shadowing et réversibilité.
Si vous n’avez pas la bande passante pour construire vite, un pod nearshore de 2–3 ingénieurs seniors peut livrer un MVP en 6–8 semaines avec 6–8 heures de recouvrement avec les fuseaux US. Le travail relève de la plomberie et de la discipline, pas d’un doctorat en ML.
Et la voix et la vidéo, spécifiquement ?
La voix et la vidéo sont là où les routeurs prouvent leur utilité — et où les approches naïves font le plus mal :
- Voix : Faites respecter des budgets serrés par tour. Routez les tours de small talk vers un très petit modèle rapide ; n’escaladez que pour les décisions ou les résumés. Détectez les emballements de latence et dégradez avec grâce : « Laissez‑moi vérifier » plus un indicateur de chargement est mieux que le silence radio.
- Vidéo : N’envoyez pas des clips entiers à un modèle de pointe. Scorez d’abord : intensité d’action, mouvement, visages, changements de scène. Routez 80–90 % vers des poids ouverts ; n’escaladez que quand le score l’exige. Mettez en cache les sous‑titres ; ils se répètent.
Lien avec l’actualité du marché
Le lancement d’un routeur par Runway prouve que la spécialisation bat le « one‑size‑fits‑all » dans les médias. Le mode voix plus capable d’Anthropic vous rappelle que le « meilleur » change chaque mois. Les équipes open‑weight livrent une qualité quasi‑frontière pour un tiers du prix. Votre avantage ne viendra pas de parier sur le gagnant de demain, mais de faire du routage une politique explicite et testable qui absorbe la volatilité du marché sans brûler votre budget ni votre UX.
Points clés
- Les routeurs de modèles ne sont pas magiques. Encodez vos contraintes métier — latence, coût, conformité, segment — dans un RequestEnvelope et explicitez la politique de routage.
- Optimisez pour le coût effectif par réussite, pas le coût par 1 000 tokens. Une meilleure qualité de routage peut réduire la dépense de 20–40 % sans dégrader l’UX.
- Construisez une pile en quatre couches : Politique, Décision (règles → apprentissage), Exécution (adaptateurs/caches) et Observabilité (un vrai registre des coûts).
- Utilisez champion‑challenger avec shadowing et kill switches. Ne promouvez que sur des gains statistiquement solides.
- La voix/vidéo exigent des budgets plus stricts et de meilleurs signaux (SNR, mouvement/action). Scorez d’abord, puis escaladez.
- Achetez les adaptateurs et outils d’évaluation ; construisez la politique et la logique de décision. Les routeurs fournisseurs qui cachent la politique sont un passif.