Scaleway Generative APIs : l'inférence IA souveraine, made in France

Si tu veux faire tourner un grand modèle de langage sans envoyer tes données chez un fournisseur américain ou chinois, tes options sont plus rares qu’il n’y paraît. C’est exactement le créneau de Scaleway Generative APIs : une offre d’inférence à l’appel, hébergée en France, qui te donne accès aux meilleurs modèles open-weight du moment sans gérer un seul GPU. Voici un tour d’horizon complet, du « qui c’est » jusqu’aux prix.

Qui est Scaleway

Scaleway est le cloud souverain européen, filiale du groupe iliad (la maison mère de Free)1. L’entreprise existe depuis longtemps dans le paysage de l’hébergement français et s’est repositionnée ces dernières années comme un acteur cloud et IA complet, avec des datacenters répartis en Europe, des instances GPU (jusqu’aux dernières puces NVIDIA Blackwell), du stockage, du serverless, et donc une offre d’inférence managée.

L’argument central, c’est la souveraineté. Quand Scaleway a ajouté GLM-5.2 à son catalogue dix jours après sa sortie, l’entreprise est devenue le premier cloud souverain en Europe à proposer ce modèle2. Et le discours est constant sur toute la gamme : tout tourne sur une infrastructure européenne, dans un environnement isolé, sans routage tiers ni télémétrie renvoyée vers le fournisseur du modèle2.

Pourquoi c’est intéressant : le « serverless » de l’IA

Concrètement, Scaleway propose deux formules.

Generative APIs - Serverless : tu appelles un modèle via une API, tu paies au million de tokens, et tu n’as rien à gérer. Le matériel est déjà en place, pas de temps de démarrage3. C’est la façon la plus simple de commencer, et c’est ce qui nous intéresse ici.

Generative APIs - Dedicated Deployment (ex-Managed Inference) : tu déploies un modèle sur une infrastructure GPU dédiée, facturée à l’heure, pour un débit garanti et des fonctions de sécurité avancées comme l’isolation réseau privée3.

Pour la plupart des cas d’usage, le serverless suffit. Quelques points pratiques qui font la différence :

  • API compatible OpenAI : tu peux brancher tes outils existants (clients OpenAI, LangChain) en changeant juste l’URL de base et la clé3. La migration depuis OpenAI est quasi indolore.
  • Confidentialité des données : Scaleway annonce ne pas collecter, lire, réutiliser ni analyser le contenu de tes prompts et des réponses générées4.
  • Hébergement en France : les modèles sont hébergés dans un datacenter sécurisé à Paris4. Pour un workload sensible au RGPD, tu peux le présenter à un service juridique sans sourciller.
  • Free tier : le premier million de tokens est gratuit, tu n’es facturé qu’à partir du token 1 000 0015.
  • Batch API : les requêtes non temps réel bénéficient d’une remise de 50 %5.

Les modèles et leurs prix

Voici le catalogue serverless en juin 2026, prix hors taxes par million de tokens5. J’ai trié du plus capable au plus léger.

Modèle Entrée €/1M Sortie €/1M Usage
glm-5.2 1,80 5,50 Chat + code, agentique
mistral-medium-3.5-128b 1,50 7,50 Chat, code, vision
qwen3.5-397b-a17b 0,60 3,60 Chat, code, vision
qwen3-235b-a22b 0,75 2,25 Chat
devstral-2-123b 0,40 2,00 Chat + code
llama-3.3-70b 0,90 0,90 Chat
holo2-30b-a3b 0,30 0,70 Chat, vision
qwen3.6-35b-a3b 0,25 1,50 Chat, code, vision
gemma-4-26b-a4b 0,25 0,50 Chat, code, vision
qwen3-coder-30b-a3b 0,20 0,80 Chat + code
pixtral-12b 0,20 0,20 Chat, vision
gpt-oss-120b 0,15 0,60 Chat
mistral-small-3.2-24b 0,15 0,35 Chat, vision

À cela s’ajoutent des modèles d’embeddings (à partir de 0,10 €/1M) et de transcription audio comme Whisper Large v3 (0,003 €/minute)5.

Le réflexe à avoir : ne mets pas tout sur GLM-5.2. Pour du code agentique exigeant, GLM-5.2 ou Qwen3.5-397b se justifient. Mais pour des tâches plus simples (résumé, classification, extraction), gpt-oss-120b ou mistral-small coûtent dix fois moins cher sur le même cloud souverain.

La vitesse d’inférence : le point faible documentaire

C’est la limite de l’exercice : Scaleway ne publie pas de débit en tokens par seconde sur sa page tarifaire. La seule métrique annoncée est un temps de premier token sous 200 ms pour les utilisateurs en Europe4. C’est correct pour du dialogue interactif, mais ça ne te dit pas à quelle vitesse le modèle écrit la suite de sa réponse. Si la latence est critique pour ton cas d’usage, il faudra benchmarker toi-même.

Comment ça se compare

Face à Groq

Groq : l’inférence la plus rapide du marché, et ce qu’il faut savoir avant de l’utiliser joue dans une autre catégorie. Son architecture LPU délivre 500+ tokens par seconde, l’inférence la plus rapide du marché6, et ses prix planchers sont imbattables (Llama 3.1 8B à 0,05 $/1M). Mais Groq héberge aux États-Unis, son catalogue se limite aux petits et moyens modèles open-source, et il ne propose aucun modèle frontier type GLM-5.26.

La bonne façon de voir les choses : Groq pour la vitesse brute et le temps réel, Scaleway pour la souveraineté et les modèles capables. Ce ne sont pas deux versions du même produit.

Face à Mistral en direct

Subtilité importante pour les modèles Mistral : Scaleway facture en euros des montants nominalement identiques à ceux de Mistral en dollars. Mistral Medium 3.5 est à 1,50 $ / 7,50 $ chez Mistral7, et 1,50 € / 7,50 € chez Scaleway. L’euro étant plus fort que le dollar, tu paies donc environ 8 % de plus chez Scaleway une fois converti.

Et surtout, Mistral La Plateforme héberge aussi en UE8. Donc si tu n’utilises que du Mistral, va directement à la source : c’est moins cher, c’est la dernière génération de modèles, et c’est tout aussi européen. L’intérêt de Scaleway n’est pas le prix sur Mistral, c’est le guichet unique : GLM-5.2, Qwen, Llama et Mistral derrière une seule API et une seule facture souveraine.

Verdict

Scaleway Generative APIs, c’est l’option à regarder en priorité quand la localisation des données en France est un critère non négociable, et que tu veux un modèle frontier sans monter ta propre infra GPU. Tu paies un léger surcoût par rapport aux providers américains ou chinois les moins chers, mais c’est le prix de la souveraineté, et il reste raisonnable.

Pour résumer le choix :

  • Données sensibles, clients européens, besoin d’un modèle capable → Scaleway.
  • Vitesse temps réel sur petits modèles → Groq.
  • Uniquement du Mistral → Mistral La Plateforme en direct.
  • Optimisation au token près sans contrainte de localisation → providers type DeepInfra ou GMI.

Le plus simple reste de tester : le premier million de tokens est gratuit, de quoi se faire une idée sur tes propres prompts avant d’engager le moindre euro.

Sources

  1. Scaleway, page d'accueil et présentation entreprisescaleway.com
  2. Scaleway : GLM-5.2 now available on Generative APIsscaleway.com
  3. Scaleway Generative APIs FAQ (Serverless vs Dedicated)scaleway.com
  4. Scaleway Generative APIs (présentation produit, confidentialité, latence)scaleway.com
  5. Scaleway Model-as-a-service Pricingscaleway.com
  6. Groq : l'inférence la plus rapide du marché (article du blog)apprendre-et-avancer.fr
  7. Fello AI : Mistral AI Pricing 2026felloai.com
  8. AI Pricing Guru : Mistral AI API Pricing (résidence UE)aipricing.guru

← Tous les articles