Passer au contenu principal
Passerelle IA

Omniroute : passerelle d'IA multi-modèles à faible latence avec cache sémantique.

Conception d'une passerelle d'inférence sous 15ms normalisant les requêtes OpenAI et Anthropic avec supervision temps réel, cache sémantique Redis et routage dynamique.

RôleIngénieur cloud et réseau
Période2026
ContexteArchitecture edge haute performance
PlateformeNode.js • Redis • Cloudflare Workers • Traefik
Architecture Passerelle Omniroute

La problématique : éliminer les pannes de fournisseurs et les requêtes redondantes.

Les applications connectées directement aux APIs d'IA subissent des pics de latence, des dépassements de quotas et des divergences de schémas. Omniroute a été conçu comme une couche d'entrée unifiée qui normalise les payloads, met en cache les prompts identiques ou sémantiquement proches dans Redis et bascule automatiquement sur un modèle secondaire en cas de dépassement de seuil.

Architecture streaming edge.

Les requêtes arrivent via le réseau Cloudflare avec terminaison SSL et limitation de débit. Un proxy de streaming Node.js analyse les flux de tokens morceau par morceau sans allocation de tampon intermédiaire, mesurant en temps réel le TTFT (Time to First Token) et indexant les hashs vectoriels dans Redis.

Défis techniques clés.

  • Maintien de l'intégrité du streaming SSE (Server-Sent Events) tout en calculant la consommation de tokens au fil de l'eau.
  • Stratégies d'invalidation du cache sémantique selon la température et l'aléa des requêtes.

Performances clés.

Surcoût de routage< 14ms
Taux de succès cache38.4%
Bascule automatique< 180ms
Débit supporté1,200 req/min