MarkTechPost

L’architecte lance Liquid Inference, une mise en vente en temps réel pour l’inférence des LLM.

Architect Financial Technologies a lancé Liquid Inference, un routeur de LLM qui organise une vente aux enchères en temps réel pour chaque demande. Liquid Inference est un marché d’inférence de LLM proposé par Architect…

Architect Financial Technologies a lancé Liquid Inference, un routeur de LLM qui organise une vente aux enchères en temps réel pour chaque demande. Liquid Inference est un marché d’inférence de LLM proposé par Architect, où les fournisseurs participent en offrant des prix pour répondre à chaque demande. L’acheteur paie le prix le plus bas qui respecte ses règles. Pour les développeurs, il s’agit d’une idée simple : changer une URL de base, conserver leur code, et laisser les fournisseurs concurrencer sur le prix.

Qu'est-ce que Liquid Inference ?

Liquid Inference est un routeur de type échange pour l’inférence de LLM. Selon Architect, les fournisseurs publient des offres pour servir des modèles spécifiques. Chaque demande est mise en vente auprès de tous les fournisseurs, en indiquant le modèle concerné. La offre la moins chère qui respecte les critères du acheteur gagne.

Le produit provient d’une société de commerce, et non d’un laboratoire d’IA. Architect gère l’bourse perpétuelle AX des futures GPU. En mai 2026, il a acquise un marché contract US désigné afin de lister les futures GPU, en attente d’une revue réglementaire. L’équipe a utilisé son expérience dans la création de bourses financières pour établir une découverte de prix bilatérale pour les inférences.

Comment fonctionne l’enchère d’inférence ?

Le flux comporte 4 étapes :

  1. Demande : Un client envoie une requête standard via l’API OpenAI ou Anthropic.
  2. Règles : Les contraintes du acheteur filtrent les offres éligibles.
  3. Vente aux enchères : Les fournisseurs qui proposent le modèle compétissent. La offre la plus basse est retenue.
  4. Reçu : Le prix maximal est fixé avant la génération. La facture couvre uniquement l’utilisation mesurée.

Les acheteurs peuvent définir Plafonds de coût par travail, limites de temps pour obtenir le premier token et débit minimal. Ils peuvent également exiger des régions approuvées, zéro stockage de données et des listes d’autorisation pour fournisseurs ou modèles. Le mode Auto peut choisir le modèle pour une unité de travail donnée. Harrison’s Post sur LinkedIn Ajoute des préparations de règles de routage et un soutien complet multi-mode.

Les détenteurs de comptes peuvent consulter les livres d’ordres en temps réel, les offres par fournisseur et par modèle, ainsi que les transactions effectuées. Ce niveau de données de marché est inhabituel pour une API LLM.

Qu’obtiennent les acheteurs ?

  • Compatibilité instantanée avec les outils de codage agentique. Les posts listent Claude Code, Codex, OpenCode, Cursor, Pi et Cline.
  • Inscription gratuite pour e-mail. Les 500 premiers utilisateurs reçoivent 20 $ gratuits pour inférence, selon Harrison.
  • Un programme de référence : 20 % des frais de référence sont offerts gratuitement, et 10 % pour les références de deuxième niveau.

Qu’obtiennent les fournisseurs d’inférence ?

Les fournisseurs sont intégrés via l’application Liquid Inference. Harrison affirme que les nouveaux fournisseurs sont vérifiés « en minutes, pas en semaines ». Tous les prompts utilisent la norme OpenAI API. Les API REST et WebSocket permettent l’enregistrement des modèles et des devis.

Les fournisseurs peuvent mettre à jour les devis en fonction de leurs propres coûts. Cela leur permet de vendre la capacité de GPU disponible uniquement lorsqu’ils le souhaitent. Les paiements sont effectués via Stripe, avec des rapports détaillés pour chaque mission.

Comment Liquid Inference se compare à OpenRouter et à Hugging Face ?

CaractéristiqueLiquid InferenceOpenRouterHugging Face Inference Providers
Modèle de routageAuction par demande via les fournisseurs de devisBalancing de charge pondéré par prix, inversé du carré du prixFournisseur le plus rapide par défaut ; suffixe :cheapest optionnel
Nombre de modèles / fournisseurs“Centaines” de modèles ; les fournisseurs ne sont pas révélés500+ modèles, 80+ fournisseurs18 partenaires listés
Compatibilité APIOpenAI et compatible avec AnthropicCompatible avec OpenAICompatible avec OpenAI, uniquement chat
Plafond de prixPrix maximal verrouillé avant le premier jetmax_price paramètreNon divulgué
Contrôles des donnéesZDR, régions, listes d’autorisationzdr, data_collection, only/ignoreOrdre de préférence du fournisseur
Frais de plateformeNon divulguéFrais de crédit pour carte à 5,5 %, minimum de 0,80 $Aucun marquage
Crédits gratuits$20 pour les premiers 500 utilisateursNon divulgué$0,10/mois gratuit, $2,00 PRO
Données du marché publicBourses en temps réel et transactions clôturéesNon divulguéNon divulgué

Résumés clés

  • Liquid Inference fait des ventes pour chaque demande de LLM auprès de plusieurs fournisseurs concurrents.
  • Le prix maximal est verrouillé avant le premier token, avec un reçu par tâche.
  • Fonctionne avec les clients OpenAI et Anthropic, y compris Claude Code et Cursor.
  • Les premiers 500 utilisateurs reçoivent 20 $ gratuitement ; les références génèrent 20 % des commissions.
  • Les frais, la liste des fournisseurs et les données de latence ne sont pas encore publiés.


Veuillez consulter les détails techniques. Toute la reconnaissance appartient au chercheur de ce projet. De plus, n’hésitez pas à nous suivre sur Twitter, et ne oubliez pas de rejoindre notre subreddit 150k+ML ainsi que notre bulletin email. Attendez ! êtes-vous sur Telegram ? Maintenant, vous pouvez également nous rejoindre sur Telegram.

La publication Architect Launches Liquid Inference, une auction en temps réel pour l’inférence des LLM a été publiée en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original