$ python -m mlx_lm.server --port 8080
model loaded: quantized/model-4bit
listening on 0.0.0.0:8080
POST /v1/chat/completions 200
Gardez Apple Silicon dans le cloud
Exécutez en continu l’inférence IA, les builds iOS et macOS ainsi que les tâches automatisées. Chaque commande correspond à un Mac mini physique dédié, et non à une machine virtuelle, à partir de $19.2/jour.
La puissance de calcul reste dans la région, l’équipe y accède à tout moment
Apple Silicon, mémoire et chaîne d’outils restent disponibles en permanence. La validation des modèles et l’historique des builds ne s’interrompent pas lorsque l’ordinateur personnel est en veille ou qu’un membre de l’équipe est hors ligne.
Un environnement cohérent, sans se transmettre les ordinateurs
Les développeurs se connectent au même Mac physique toujours disponible via SSH ou VNC pour consulter les journaux de build, les processus de modèles et les fichiers du projet.
Dédié, continu, maîtrisé
Vérifiez d’abord la nature de la machine, son mode d’exécution et les limites d’accès afin de déterminer si elle convient à votre workflow d’équipe.
Mac mini physique dédié
Chaque commande correspond à un nœud physique indépendant. La puce, la mémoire et le stockage de base ne sont pas partagés avec d’autres locataires sur la même instance d’exécution, ce qui facilite la reproductibilité des expériences et des environnements de build.
Configuration physique, pas une machine virtuelle
Les trois configurations correspondent directement au matériel du Mac mini. Choisissez selon la mémoire, le stockage et les capacités réelles de la puce pour planifier les builds Xcode, la concurrence des runners ou la taille des modèles MLX.
Exécution à distance 24 h/24
Tous les nœuds fonctionnent normalement 365 jours par an. Connectez-vous via SSH ou VNC et laissez les tâches longues continuer après la déconnexion des membres de l’équipe.
Du modèle quantifié à l’API MLX
Validez d’abord le modèle sur une configuration fixe, puis encapsulez le processus d’inférence dans une interface distante. Le chemin du modèle, les limites mémoire, l’adresse d’écoute et les journaux des requêtes restent consultables.
Synchronisez les fichiers du modèle, verrouillez les versions de Python, MLX et des dépendances du projet, puis consignez les paramètres de démarrage et le répertoire de travail.
Utilisez le même ensemble de prompts pour observer la mémoire maximale, la latence du premier token, le débit continu et la cohérence des sorties.
Vérifiez l’adresse d’écoute, l’accès au port, la supervision du processus et les journaux d’erreur afin de ne pas valider uniquement le résultat de la ligne de commande locale.
Passez des requêtes locales aux appels distants de l’application et conservez les traces des appels pour les délais d’expiration, les nouvelles tentatives et le changement de modèle.
- Format du modèle
- 4-bit MLX
- Mémoire relevée
- 42.8 / 64GB
- Adresse d’écoute
- 0.0.0.0:8080
- État de la requête
- HTTP 200
- Point d’accès
- /v1/chat/completions
Les données sont fournies à titre d’exemple pour illustrer les métriques à consigner et ne représentent pas les performances fixes d’un modèle ou d’une configuration spécifiques. Les résultats réels dépendent du modèle, de la quantification, de la longueur du contexte et de la concurrence.
Examinez le matériel, puis choisissez la durée
À partir de $19.2/jour. Les trois formules sont disponibles à la journée, à la semaine, au mois ou au trimestre. Toutes les commandes sont facturées en dollars américains (USD).
VMKeep M4 Core
M4
16GB RAM
256GB SSD
$51.7 / semaine · $95.8 / mois · $260.6 / trimestre
Idéal pour les builds Xcode légers, les scripts automatisés, les petits runners et la validation d’environnements MLX. Pour des caches de dépendances plus volumineux ou des tâches continues, comparez plutôt la configuration intermédiaire.
VMKeep M4 Plus
M4
24GB RAM
512GB SSD
$106.3 / semaine · $196.9 / mois · $535.6 / trimestre
Adapté à la CI continue, aux caches de dépendances volumineux, aux builds React Native et à la validation de modèles MLX intermédiaires, avec un équilibre entre capacité et coût d’exécution prolongée.
VMKeep M4 Pro
M4 Pro
64GB RAM
2TB SSD
$164.1 / semaine · $303.8 / mois · $826.3 / trimestre
Adapté à l’inférence MLX exigeante en mémoire, à l’évaluation de modèles volumineux, aux builds multitâches et aux workflows nécessitant de conserver localement de nombreux modèles ou artefacts de build.
Choisissez l’emplacement le plus proche de votre équipe ou de vos utilisateurs parmi 5 régions
Les trois modèles sont disponibles à Singapour, au Japon (Tokyo), en Corée du Sud (Séoul), à Hong Kong et dans l’Est des États-Unis. Les combinaisons du catalogue sont généralement disponibles ; l’état réel est celui renvoyé en temps réel par la console.
Les plages de latence servent à orienter le premier choix de région. Le réseau réel dépend de l’emplacement d’accès, de l’opérateur et du routage au moment de la connexion. Testez depuis le réseau de votre équipe avant l’intégration définitive.
La console centralise les machines, les durées, les commandes et les opérations de gestion. Les méthodes de connexion et la checklist de première utilisation sont disponibles dans la page d’assistance.
Voir les instructions de connexion et de migrationÉvaluez l’adéquation selon les entrées, l’exécution et les résultats
Un Mac dans le cloud fournit un environnement Apple Silicon toujours disponible et un accès à distance. Les performances réelles dépendent de la taille du code, des paramètres du modèle, de la structure des dépendances et de la configuration choisie.
Builds iOS / macOS
Organisez le code, les dépendances, la chaîne d’outils Xcode et les éléments de signature dans un répertoire fixe, puis exécutez les tests, l’archivage et les contrôles avant publication.
- Entrées
- Code, dépendances et configuration de signature
- Exécution
- xcodebuild et scripts automatisés
- Résultats
- Rapports de test, journaux et archives
Self-hosted runner
Affectez les tâches du dépôt à un nœud physique dédié et planifiez le répertoire de travail, le cache des dépendances, les limites de concurrence et l’ordre des nouvelles tentatives.
- Entrées
- Événements du dépôt et tâches du pipeline
- Exécution
- Runner permanent et répertoire de cache
- Résultats
- Journaux d’exécution, résultats de test et artefacts
Expériences d’inférence MLX
Avec une puce et une mémoire fixes, comparez les versions quantifiées, la mémoire maximale, la latence du premier token et le débit continu, puis encapsulez le tout dans une API distante.
- Entrées
- Modèle, prompts et paramètres d’inférence
- Exécution
- Serveur MLX et scripts d’évaluation
- Résultats
- API, métriques et conclusions du modèle
Station de travail graphique distante
Utilisez SSH pour les tâches en ligne de commande et VNC pour l’interface graphique macOS. Convient aux projets ponctuels, à la collaboration entre régions et à l’augmentation temporaire de capacité.
- Entrées
- Fichiers de projet, chaîne d’outils et ressources
- Exécution
- Accès distant SSH ou VNC
- Résultats
- Fichiers de projet, résultats de build et historiques
Des durées claires, un règlement en dollars
Lors de la commande, confirmez successivement le modèle, la région, la durée et les options supplémentaires. La disponibilité réelle de la passerelle de paiement est celle indiquée par la console.
Louez à la journée, à la semaine, au mois ou au trimestre
Pour une validation courte, commencez à la journée ou à la semaine ; pour une CI continue, un service d’inférence prolongé ou un environnement distant fixe, comparez les formules mensuelle et trimestrielle. Avant le renouvellement, vérifiez la configuration, la région, la période et le plan de migration des données.
Deux moyens de paiement uniquement
Toutes les commandes sont facturées en dollars américains (USD), sans conversion dans une autre devise.
Choisissez la configuration selon la mémoire du modèle, le cache de build et les tâches concurrentes ; choisissez la région selon l’emplacement de l’équipe et des utilisateurs ; prévoyez l’export des données, la révocation des jetons et la suppression des clés avant la fin de la durée.
Vérifiez la nature de la machine, la région et les moyens de paiement
Ces réponses couvrent les questions de décision les plus fréquentes. Consultez la FAQ pour obtenir des informations plus complètes sur les configurations, les connexions et la facturation.
VMKeep fournit-il des machines virtuelles ?
Non. Chaque commande correspond à un Mac mini physique dédié. La configuration affichée correspond à une puce Apple Silicon, une mémoire et un stockage précis, sans partage de la même instance d’exécution avec d’autres locataires.
Puis-je exécuter un serveur d’inférence MLX ?
Oui. Validez le modèle en ligne de commande, démarrez ensuite le service d’écoute et connectez l’application via API. La compatibilité, la mémoire requise, la latence du premier token et le débit dépendent du modèle, des paramètres de quantification et de la configuration choisie.
Quelles régions sont disponibles ?
Les régions disponibles sont Singapour, le Japon (Tokyo), la Corée du Sud (Séoul), Hong Kong et l’Est des États-Unis, soit 5 nœuds ou centres de données. Les trois modèles couvrent ces 5 régions.
Quels moyens de paiement sont acceptés ?
Seuls USDT-TRC20 et Visa / Mastercard / Amex (via Stripe) sont acceptés. Tous les paiements sont facturés en dollars américains (USD). La disponibilité réelle de la passerelle est celle renvoyée par la console.
Choisissez un Mac dans le cloud toujours disponible
Choisissez une configuration parmi trois Mac physiques Apple Silicon dédiés, puis confirmez la région — Singapour, Tokyo, Séoul, Hong Kong ou Est des États-Unis — et la durée de location.