Inférence et RAG
Six GPU NVIDIA en Suisse. Datasets et secrets au pays.
Une chaîne d’inférence ou de RAG tient en quatre pièces, toutes dans le même tenant suisse : le corpus et les checkpoints sur S3, les clés de modèle et les accès base dans Vault, le GPU attaché à une VM ou à un node group Kubernetes, et le tout isolé par un VPC. Le partage est net : Hidora SA répond de l’infrastructure, du GPU et de sa disponibilité ; vous répondez du modèle, du corpus, des droits d’usage sur vos données et de l’application qui les sert. Le catalogue et les prix des six cartes : le catalogue GPU.
- 1. Corpus sur S3
- 2. Clés dans Vault
- 3. GPU attaché
- ISO 27001
- 3 DC
- SLA 99,99 %
Pour les équipes qui entraînent ou infèrent en Suisse : mêmes six cartes sur VM isolée ou node group Kubernetes. GPU Operator installe pilotes et device plugin. HAMi, optionnel, partage une carte entre pods et exige GPU Operator. Pas de certification CNCF AI Conformance. Catalogue : le catalogue GPU. Essai 14 jours.
Parcours
01
1. Corpus sur S3
Documents et checkpoints dans un bucket suisse. Object Lock si le corpus doit rester immuable, chiffrement au bucket.
02
2. Clés dans Vault
Clés de modèle, accès base et jetons d’API dans Vault as a Service, pas dans un manifeste. Images dans le registry privé.
03
3. GPU attaché
Même catalogue. Sur K8s : GPU Operator, HAMi optionnel. Workers répartis automatiquement, pas de choix de DC.
04
API
Provisionning par API et console. Terraform : en préparation.
Dans le détail
Les six cartes du catalogue : L4 24G (165 CHF/mois), L40S 48G (760), A100-80 (1495), RTX 6000 Pro 96G (1550), H100 80G (1999), H200 141G (2499). Prix de production publiés. L’essai de 14 jours, sans carte, les inclut. Un ingénieur calibre le modèle, la durée et l’isolation VPC. Trois DC suisses, Hidora SA. La garantie de capacité HA en mode normal exclut les GPU.
VM pour un data scientist isolé ou un job long. Kubernetes pour le partage, l’autoscaling et les addons. Même catalogue de cartes, même juridiction. Sur le cluster managé : GPU Operator (addon optionnel) installe pilotes NVIDIA et device plugin. HAMi, aussi optionnel, virtualise une carte entre plusieurs pods et exige GPU Operator. Hikube répartit les workers sur Genève, Gland et Lucerne : vous ne placez pas les nœuds DC par DC. Détail plateforme : la plateforme Kubernetes.
Object storage S3 en Suisse. Secrets d’accès dans Vault. Images dans Registry as a Service, pas GHCR ou ECR par défaut. Un checkpoint us-east-1 casse la souveraineté du job. Produits : le stockage objet S3, le coffre à secrets, le registry d’images.
Hidora SA opère les DC, l’attachement GPU, le control plane Kubernetes si vous l’utilisez, et le support FR/EN. Vous gardez images, checkpoints, code d’entraînement, topology spread des pods et le choix VM vs node group. Intégration Terraform en préparation : aujourd’hui, API Hikube et console. Pas CNCF AI Conformance.
Inférence en Suisse sur données qui ne doivent pas sortir. Fine-tuning sur datasets internes. Jobs batch sur VM. Partage de carte via HAMi sur Kubernetes. Ce n’est pas un catalogue mondial de milliers de GPU, ni un PaaS ML opaque.
Six SKUs publiés, pas une ferme. L4 24G (165 CHF/mois) : inférence et vision sur petits modèles. L40S 48G (760) : inférence plus large, rendu. A100-80 (1495) : fine-tuning et entraînement. RTX 6000 Pro 96G (1550) : plus de VRAM, profil workstation. H100 80G (1999) : entraînement plus exigeant. H200 141G (2499) : plus de mémoire pour contextes longs. Nous ne publions pas de tokens/s ni d’IOPS. L’ingénieur calibre dans l’essai. Catalogue : le catalogue GPU.
Checkpoints, poids et jeux froids : object storage S3 en Suisse. Secrets d’accès dans Vault, pas un KMS US. Pour un scratch disque attaché à la VM ou au pod : volumes NVMe réseau, toujours géo-redondants sur Genève, Gland et Lucerne, réplication synchrone (temps réel) ou asynchrone (plus performant). Sync et async n’ont pas le même RPO ; nous ne publions pas de chiffre, ni d’IOPS. Pas de volume bloc local non répliqué. Produits : le stockage objet S3, le stockage bloc, le coffre à secrets.
Non. Hikube répartit automatiquement les workers, y compris les node groups GPU, sur Genève, Gland et Lucerne. Vous ne choisissez pas le DC. Topology spread et PodDisruptionBudget pour les pods restent les vôtres. La garantie de capacité HA en mode normal exclut les GPU : une carte n’est pas un worker CPU interchangeable. Détail plateforme : la plateforme Kubernetes.
Non. Intégration Terraform et Cluster API en préparation. Aujourd’hui : API Hikube et console. kubectl, Helm et les clients S3 restent. Un cahier des charges qui exige Terraform en production aujourd’hui ne correspond pas encore au catalogue. Un ingénieur le dit au cadrage de l’essai.
Si le modèle ou le dataset touche des données de santé suisses, le cadre est la nLPD, pas HDS. Hikube n’est pas un hébergeur HDS et n’est pas certifié HDS. Datasets, checkpoints et backups restent à Genève, Gland et Lucerne. Un bucket US casse le dossier. Page santé : la santé. Support ingénieur FR/EN.
Produits liés
Questions fréquentes
L4, L40S, A100-80, RTX 6000 Pro, H100, H200. Prix CHF/mois publiés. Facturation horaire ou mensuelle. Les six sont dans l’essai 14 jours.
Non. Ils sont dans l’essai de 14 jours.
Oui, comme addons optionnels du Kubernetes managé. HAMi exige GPU Operator. Détail : la plateforme Kubernetes.
Intégration Terraform et Cluster API en préparation. Aujourd’hui : API Hikube et console.
Non. Hikube répartit automatiquement les workers sur Genève, Gland et Lucerne. Topology spread et PDB pour les pods restent de votre côté.
Non. Hikube Managed Kubernetes est Certified Kubernetes Hosted. Hidora SA est KCSP. Nous ne revendiquons pas CNCF AI Conformance.
Le support ingénieur est en français et en anglais, depuis Genève. L’allemand n’est pas une langue de support.
Prêt à tourner sur une infra 100 % suisse ?
14 jours d’essai, sans carte. GPU inclus.
