Mélange et correspondance multimodèle : itinéraire par coût, latence et politique
Agentled - Architecte systèmes

Mix-and-Match multimodèle : itinéraire par coût, latence et politique
La roulette modèle coûte cher. La solution n’est pas de « choisir le plus gros » ; c'est un acheminement par le travail avec des garde-corps.
Pourquoi c'est important maintenant
Différentes tâches comportent des SLO et des risques différents. Résumer un court e-mail ? Pas cher et rapide, c'est bien. Rédiger une annonce externe avec un langage juridique ? Exiger de la qualité et de la lignée. Un plan de contrôle qui comprend le coût, la latence, la politique et la qualité vous permet d'utiliser de petits modèles pour le travail de routine, d'intensifier les tâches à enjeux élevés et de basculer en cas d'erreurs, sans surprise.
Comment penser le routage
Définissez des SLO par tâche (par exemple, latence p95 <2,5 s, évaluation minimale 0,72). Définissez la politique (résidence dans l'UE, liste d'autorisation des fournisseurs, gestion des informations personnelles). Ajoutez un petit évaluateur qui évalue les résultats par rapport à une rubrique pour la tâche ; bloquer ou escalader s’ils ne réussissent pas. Encodez ensuite tout cela dans un simple fichier de stratégie que le routeur lit au moment de l'exécution. Traitez les modèles comme des moteurs enfichables derrière ces règles.
Exemple / Comment faire (politique + évaluateur)
Politique YAML (démarreur) :```yaml task: "create_linkedin_post" slo: { p95_latency_ms: 2500, min_eval: 0.72 } policy: residency: "EU" providers_allow: ["openai-eu", "azure-eu", "local"] pii: "mask" route:
- when: "tokens<2000" model: "mini-fast"
- when: "eval<0.72" failover: "pro-accurate"
- when: "provider_error || policy_violation" failover: "backup-compliant"
**Petit évaluateur (modèle) :**
- Ensemble doré (20 à 50 exemplaires).
- Rubrique de notation → structure, correspondance de ton, vérification des hallucinations.
- Seuils par tâche : `publish` / `needs_review` / `block`.
- Dérive : moyenne glissante vs semaine dernière ; alerte si >Δ.
**Modèles de basculement :**
- **Shadow eval :** exécutez mini + pro sur 1 tâche sur N ; utilisez Delta pour régler les seuils.
- **Réessayez la sémantique :** en cas d'erreurs de délai d'attente/de politique, basculement automatique vers un fournisseur conforme.
- **Rollback :** les alertes post-publication reviennent au dernier artefact approuvé.
### Étapes suivantes
- Choisissez **trois tâches** à acheminer (résumer, rédiger un article, extraire des entités).
- Écrivez la **politique YAML** et branchez un évaluateur de 50 exemples.
- Ajoutez une journalisation (modèle, latence, jetons, évaluation) et révisez chaque semaine pour ajuster les seuils.
- Vous voulez un harnais d'évaluateur copier-coller ? Procurez-vous le kit de démarrage ou réservez une séance de travail.
