Architect Financial Technologies a lancé Liquid Inference, un routeur de LLM qui organise une vente aux enchères en temps réel pour chaque demande. Liquid Inference est un marché d’inférence de LLM proposé par Architect, où les fournisseurs participent en offrant des prix pour répondre à chaque demande. L’acheteur paie le prix le plus bas qui respecte ses règles. Pour les développeurs, il s’agit d’une idée simple : changer une URL de base, conserver leur code, et laisser les fournisseurs concurrencer sur le prix.
Qu'est-ce que Liquid Inference ?
Liquid Inference est un routeur de type échange pour l’inférence de LLM. Selon Architect, les fournisseurs publient des offres pour servir des modèles spécifiques. Chaque demande est mise en vente auprès de tous les fournisseurs, en indiquant le modèle concerné. La offre la moins chère qui respecte les critères du acheteur gagne.
Le produit provient d’une société de commerce, et non d’un laboratoire d’IA. Architect gère l’bourse perpétuelle AX des futures GPU. En mai 2026, il a acquise un marché contract US désigné afin de lister les futures GPU, en attente d’une revue réglementaire. L’équipe a utilisé son expérience dans la création de bourses financières pour établir une découverte de prix bilatérale pour les inférences.
Comment fonctionne l’enchère d’inférence ?
Le flux comporte 4 étapes :
- Demande : Un client envoie une requête standard via l’API OpenAI ou Anthropic.
- Règles : Les contraintes du acheteur filtrent les offres éligibles.
- Vente aux enchères : Les fournisseurs qui proposent le modèle compétissent. La offre la plus basse est retenue.
- Reçu : Le prix maximal est fixé avant la génération. La facture couvre uniquement l’utilisation mesurée.
Les acheteurs peuvent définir Plafonds de coût par travail, limites de temps pour obtenir le premier token et débit minimal. Ils peuvent également exiger des régions approuvées, zéro stockage de données et des listes d’autorisation pour fournisseurs ou modèles. Le mode Auto peut choisir le modèle pour une unité de travail donnée. Harrison’s Post sur LinkedIn Ajoute des préparations de règles de routage et un soutien complet multi-mode.
Les détenteurs de comptes peuvent consulter les livres d’ordres en temps réel, les offres par fournisseur et par modèle, ainsi que les transactions effectuées. Ce niveau de données de marché est inhabituel pour une API LLM.
Qu’obtiennent les acheteurs ?
- Compatibilité instantanée avec les outils de codage agentique. Les posts listent Claude Code, Codex, OpenCode, Cursor, Pi et Cline.
- Inscription gratuite pour e-mail. Les 500 premiers utilisateurs reçoivent 20 $ gratuits pour inférence, selon Harrison.
- Un programme de référence : 20 % des frais de référence sont offerts gratuitement, et 10 % pour les références de deuxième niveau.
Qu’obtiennent les fournisseurs d’inférence ?
Les fournisseurs sont intégrés via l’application Liquid Inference. Harrison affirme que les nouveaux fournisseurs sont vérifiés « en minutes, pas en semaines ». Tous les prompts utilisent la norme OpenAI API. Les API REST et WebSocket permettent l’enregistrement des modèles et des devis.
Les fournisseurs peuvent mettre à jour les devis en fonction de leurs propres coûts. Cela leur permet de vendre la capacité de GPU disponible uniquement lorsqu’ils le souhaitent. Les paiements sont effectués via Stripe, avec des rapports détaillés pour chaque mission.
Comment Liquid Inference se compare à OpenRouter et à Hugging Face ?
| Caractéristique | Liquid Inference | OpenRouter | Hugging Face Inference Providers |
|---|---|---|---|
| Modèle de routage | Auction par demande via les fournisseurs de devis | Balancing de charge pondéré par prix, inversé du carré du prix | Fournisseur le plus rapide par défaut ; suffixe :cheapest optionnel |
| Nombre de modèles / fournisseurs | “Centaines” de modèles ; les fournisseurs ne sont pas révélés | 500+ modèles, 80+ fournisseurs | 18 partenaires listés |
| Compatibilité API | OpenAI et compatible avec Anthropic | Compatible avec OpenAI | Compatible avec OpenAI, uniquement chat |
| Plafond de prix | Prix maximal verrouillé avant le premier jet | max_price paramètre | Non divulgué |
| Contrôles des données | ZDR, régions, listes d’autorisation | zdr, data_collection, only/ignore | Ordre de préférence du fournisseur |
| Frais de plateforme | Non divulgué | Frais de crédit pour carte à 5,5 %, minimum de 0,80 $ | Aucun marquage |
| Crédits gratuits | $20 pour les premiers 500 utilisateurs | Non divulgué | $0,10/mois gratuit, $2,00 PRO |
| Données du marché public | Bourses en temps réel et transactions clôturées | Non divulgué | Non divulgué |
Résumés clés
- Liquid Inference fait des ventes pour chaque demande de LLM auprès de plusieurs fournisseurs concurrents.
- Le prix maximal est verrouillé avant le premier token, avec un reçu par tâche.
- Fonctionne avec les clients OpenAI et Anthropic, y compris Claude Code et Cursor.
- Les premiers 500 utilisateurs reçoivent 20 $ gratuitement ; les références génèrent 20 % des commissions.
- Les frais, la liste des fournisseurs et les données de latence ne sont pas encore publiés.
Veuillez consulter les détails techniques. Toute la reconnaissance appartient au chercheur de ce projet. De plus, n’hésitez pas à nous suivre sur Twitter, et ne oubliez pas de rejoindre notre subreddit 150k+ML ainsi que notre bulletin email. Attendez ! êtes-vous sur Telegram ? Maintenant, vous pouvez également nous rejoindre sur Telegram.
La publication Architect Launches Liquid Inference, une auction en temps réel pour l’inférence des LLM a été publiée en premier sur MarkTechPost.