Déployer Souveraineté API Modèles Simulateur de coût Tarifs Ouvrir la console
Cloud IA souverain — Paris, Lyon et Lannion

Trois clics, et votre modèle tourne en France.

N'importe quel modèle open source, sur des GPU hébergés dans l'Hexagone, avec une API compatible OpenAI. Vos poids, vos données, votre juridiction.

Sans carte bancaire · 20 € de crédits offerts · Facturation à la seconde

  • 14 sdémarrage à froid
  • 0 octethors de France
  • SDK OpenAIcompatible tel quel
console.lannecloud.fr

214 modèles prêts à l'emploi, mis à jour chaque semaine

MistralLlama QwenDeepSeek GemmaWhisper FLUXPhi Nomic EmbedStable Diffusion Kokoro
Déploiement

Le modèle, la région, le bouton.

console.lannecloud.fr étape 1 / 3
01 Le modèle
02 La région
03 Le déploiement

Quel modèle voulez-vous faire tourner ?

Les six plus demandés. Le catalogue en compte 214, plus tout Hugging Face.

Où voulez-vous qu'il tourne ?

Trois régions, trois datacenters, un seul droit applicable : le français.

Tout est prêt. Il ne reste qu'un clic.

Le conteneur est provisionné, chiffré et supervisé. Vous n'écrivez pas une ligne de YAML.

En attente du déploiement…
Endpoint https://api.lannecloud.fr/v1
Bac à sable en ligne
latence débit région sortie du territoire 0 octet
Démonstration interactive — aucun GPU n'a réellement été réservé.
Souveraineté

L'Hexagone. Au sens propre.

Trois datacenters, une seule frontière — celle qu'on ne franchit pas. Le matériel est français, l'exploitant est français, et le juge compétent aussi.

Aucune donnée ne sort du territoire

Prompts, réponses, fichiers, journaux : tout reste sur les serveurs français. Pas de réplication hors zone, pas de sous-traitant extra-européen.

Hors de portée du Cloud Act

LanneCloud est une société de droit français, sans capital ni maison mère américaine. Aucune administration étrangère ne peut réquisitionner vos données.

RGPD par construction, SecNumCloud en cours

Chiffrement AES-256 au repos, TLS 1.3 en transit, clés gérées par vous si vous le souhaitez. Qualification engagée avec l'ANSSI.

Zéro entraînement sur vos requêtes

Vos appels API ne servent jamais à entraîner quoi que ce soit. Rétention à zéro activable en une case à cocher.

Bleu, blanc, GPU LANNION PARIS LYON

3 régions · 0 frontière franchie · 100 % énergie décarbonée

Comparaison entre LanneCloud, un hyperscaler américain et un serveur sur site
 LanneCloudHyperscaler américainServeur sur site
Localisation des donnéesFrance, région au choixSouvent multi-régionsVos locaux
Droit applicableFrançais uniquementCloud Act, FISA 702Français
Délai de mise en service14 secondesQuelques minutes3 à 9 mois
Investissement de départ0 €0 €60 000 € et plus par GPU
FacturationÀ la seconde, zéro à l'arrêtÀ l'heure, minimum facturéAmortissement fixe
Frais de sortie des données0 €0,08 à 0,12 € / Go
Choix des modèles214 modèles + import libreCatalogue restreintLibre, à votre charge
Maintenance matérielleIncluseIncluseVotre équipe
0 s
Démarrage à froid
0 %
SLA contractuel
0 ms
Latence depuis Paris
0
Octet hors de France
API

Une API que vous connaissez déjà.

Changez l'URL de base, gardez votre code. Nos endpoints sont compatibles avec le SDK OpenAI : migration en une ligne, retour arrière tout aussi simple.

Streaming SSE, appels de fonctions, sorties JSON structurées et vision selon les modèles.
Mise à l'échelle automatique de zéro à des centaines de requêtes par seconde, facturée à la seconde de GPU.
Clés à portée limitée, quotas par projet, journal d'audit exportable et endpoints privés.
Terraform et CLI officiels, pour ceux qui préfèrent trois lignes à trois clics.
Voir la référence complète
# Un modèle déployé, une clé, c'est tout.
curl https://api.lannecloud.fr/v1/chat/completions \
  -H "Authorization: Bearer $LANNE_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-small-3.2-24b",
    "messages": [
      {"role": "user", "content": "Résume ce contrat en 5 points."}
    ],
    "stream": true
  }'
from openai import OpenAI

client = OpenAI(
    base_url="https://api.lannecloud.fr/v1",
    api_key=os.environ["LANNE_KEY"],
)

flux = client.chat.completions.create(
    model="mistral-small-3.2-24b",
    messages=[{"role": "user", "content": "Résume ce contrat."}],
    stream=True,
)

for bloc in flux:
    print(bloc.choices[0].delta.content or "", end="")
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.lannecloud.fr/v1",
  apiKey: process.env.LANNE_KEY,
});

const flux = await client.chat.completions.create({
  model: "mistral-small-3.2-24b",
  messages: [{ role: "user", content: "Résume ce contrat." }],
  stream: true,
});

for await (const bloc of flux)
  process.stdout.write(bloc.choices[0].delta.content ?? "");
# Les trois clics, en trois lignes.
resource "lannecloud_deployment" "assistant" {
  model    = "mistral-small-3.2-24b"
  region   = "fr-par-1"
  gpu      = "h100-80"

  autoscale {
    min_replicas = 0
    max_replicas = 12
  }

  privacy {
    retention_seconds = 0
    egress_allowed    = false
  }
}
Compatible SDK OpenAI · v1
Catalogue

Les modèles, au prix du GPU.

Pas de marge cachée sur les jetons, pas de tarif « entreprise » qui double en silence. Vous payez le calcul consommé, à la seconde.

Mistral Small 3.2

Texte
Paramètres24 Md
Contexte128 000 jetons
Prix0,18 € / M jetons
Déployer

Llama 3.3

Texte
Paramètres70 Md
Contexte128 000 jetons
Prix0,52 € / M jetons
Déployer

Qwen3

Multilingue
Paramètres32 Md
Contexte128 000 jetons
Prix0,24 € / M jetons
Déployer

DeepSeek-R1 Distill

Raisonnement
Paramètres70 Md
Contexte64 000 jetons
Prix0,58 € / M jetons
Déployer

Magistral

Raisonnement
Paramètres24 Md
Contexte40 000 jetons
Prix0,26 € / M jetons
Déployer

Whisper Large v3

Audio
Langues99
Débit~40× temps réel
Prix0,004 € / min
Déployer

Kokoro TTS

Synthèse vocale
Voix28
Latence~180 ms
Prix0,003 € / min
Déployer

FLUX.1 [dev]

Image
Résolutionjusqu'à 2 Mpx
Latence~3,2 s
Prix0,022 € / image
Déployer

Votre modèle n'est pas dans la liste ? Collez une adresse Hugging Face ou téléversez vos poids : LanneCloud construit le conteneur, choisit le GPU et expose l'API.

Importer un modèle
Simulateur

Votre facture, avant de signer.

Déplacez le curseur. Le calcul est le même que celui de votre relevé mensuel — sans frais de sortie, sans minimum, sans surprise.

Volume mensuel50 M jetons
Modèle
Données transférées200 Go
LanneCloud · formule Studio
Hyperscaler américain équivalent
économisés par an, frais de sortie inclus

Estimation : tarif LanneCloud public + 49 € d'abonnement Studio. Référence marché calculée sur une moyenne des grilles publiques d'inférence gérée (≈ 2,3×) et 0,09 € / Go de frais de sortie. Les prix réels dépendent de votre profil de charge.

Ils ont migré

Trois clics, puis plus jamais la question.

« On a basculé 40 millions de jetons par mois en une après-midi. La direction juridique a validé en lisant une seule ligne : droit français. »

Camille ReverdyDirectrice technique, Verso Santé

« Notre marché public exigeait un hébergement qualifié. LanneCloud a été le seul à répondre sans clause d'extraterritorialité. »

Thomas AguilarDSI, collectivité territoriale

« Facture divisée par deux, latence divisée par trois, et je peux enfin tester un modèle sans ouvrir un ticket. »

Naïma BouchardFondatrice, Fabrique Légale
Tarifs

Trois formules. Aucune surprise.

Le calcul est facturé à la seconde d'utilisation réelle. Un modèle inactif ne coûte rien.

Prix au million de jetons

Open source hébergé en France, face aux API des laboratoires.

10×moins cher en moyenne

Échelle en euros par million de jetons, entrée et sortie confondues. LanneCloud : Llama 3.3 70B, open source, GPU français. Laboratoires : grilles publiques converties en euros, hors cache et contrats volume.

Atelier

Pour tester, prototyper et se faire une idée.

0 €/ mois
  • 20 € de crédits offerts à l'inscription
  • 1 modèle déployé simultanément
  • 60 requêtes / minute
  • Support communautaire
Commencer gratuitement
Le plus choisi
Studio

Pour les équipes qui mettent en production.

49/ mois + calcul
  • Déploiements illimités et mise à l'échelle automatique
  • Endpoints privés et clés à portée limitée
  • Import de modèles et affinage LoRA
  • Journal d'audit et métriques exportables
  • Réponse support sous 4 heures
Démarrer l'essai de 14 jours
Souverain

Pour le secteur public, la santé, la défense et la finance.

Sur devis
  • GPU dédiés et réseau isolé (VPC)
  • Chiffrement à clés client (BYOK)
  • Parcours SecNumCloud et HDS
  • Engagement de réversibilité écrit
  • Ingénieur référent et support 1 heure
Parler à un ingénieur

Prix HT, en euros, facturés depuis la France. Résiliable à tout moment, sans frais de sortie.

Questions

Ce qu'on nous demande le plus.

Où sont physiquement mes données ?

Dans l'un des trois datacenters que nous opérons à Paris, Lyon ou Lannion — celui que vous choisissez au déploiement. Les sauvegardes restent dans la même région. Aucune réplication, aucun transit et aucun sous-traitant hors du territoire français.

Puis-je déployer un modèle qui n'est pas au catalogue ?

Oui. Collez l'adresse d'un dépôt Hugging Face ou téléversez vos poids : nous détectons l'architecture, construisons l'image, sélectionnons le GPU adapté et exposons l'API. Les formats GGUF, safetensors et les adaptateurs LoRA sont pris en charge.

Qu'est-ce que ça change par rapport à un hyperscaler américain ?

Le droit applicable. Un fournisseur soumis au Cloud Act peut être contraint de communiquer vos données à une autorité étrangère, où qu'elles soient stockées. LanneCloud est une société française détenue par des capitaux français : seule la justice française peut nous solliciter, et vous en êtes informé.

Comment le GPU est-il facturé ?

À la seconde d'inférence réelle, sans minimum de facturation. Un modèle sans trafic redescend à zéro et ne coûte rien. Vous pouvez aussi réserver un GPU dédié au mois, avec une remise d'environ 40 % sur le tarif à la demande.

Puis-je affiner un modèle sur mes propres données ?

Oui, en LoRA ou en affinage complet, sur la même infrastructure. Le jeu de données reste dans votre espace chiffré, il n'est jamais mutualisé et les poids produits vous appartiennent — vous pouvez les télécharger à tout moment.

Que se passe-t-il en cas de pic de trafic ?

L'autoscaling ajoute des répliques en quelques secondes, dans la limite que vous fixez. Au-delà, les requêtes sont mises en file plutôt que rejetées, et vous recevez une alerte. Aucune facturation ne peut dépasser le plafond mensuel que vous définissez.

Et si je veux partir ?

Vous exportez vos poids, vos configurations et vos journaux en une commande CLI, puis vous supprimez votre espace. Aucun frais de sortie, aucun format propriétaire, aucune période d'engagement sur les formules Atelier et Studio.

Prêt ?

Votre premier modèle tourne dans 90 secondes.

Créez un compte, choisissez un modèle, cliquez trois fois. Les 20 € de crédits couvrent largement les premiers millions de jetons.