$ python -m mlx_lm.server --port 8080
model loaded: quantized/model-4bit
listening on 0.0.0.0:8080
POST /v1/chat/completions 200
Apple Silicon in der Cloud
Lassen Sie KI-Inferenz, iOS- und macOS-Builds sowie Automatisierungsaufgaben dauerhaft laufen. Jede Bestellung umfasst einen dedizierten physischen Mac mini, keine virtuelle Maschine, ab $19.2/Tag.
Rechenleistung am Knoten, jederzeitiger Teamzugriff
Die feste Kombination aus Apple Silicon, Arbeitsspeicher und Toolchain bleibt dauerhaft verfügbar. Modelltests und Build-Protokolle werden nicht durch den Ruhezustand eines persönlichen Computers oder die Abwesenheit von Teammitgliedern unterbrochen.
Konsistente Umgebung, Zusammenarbeit ohne Computerübergaben
Entwickler greifen per SSH oder VNC auf denselben dauerhaft verfügbaren physischen Mac zu und sehen Build-Protokolle, Modellprozesse und Projektdateien ein.
Dediziert, dauerhaft verfügbar, kontrollierbar
Prüfen Sie zunächst Geräteeigenschaften, Betriebsweise und Zugriffsgrenzen, bevor Sie entscheiden, ob der Dienst zu Ihrem bestehenden Team-Workflow passt.
Dedizierter physischer Mac mini
Jede Bestellung entspricht einem eigenen physischen Knoten. Chip, Arbeitsspeicher und Basisspeicher werden nicht mit anderen Mietern innerhalb derselben Laufzeitumgebung geteilt – ideal für reproduzierbare Experimente und Build-Umgebungen.
Keine virtuelle Maschine
Die drei Konfigurationen entsprechen direkt der Mac-mini-Hardware. Planen Sie Xcode-Builds, Runner-Parallelität oder die Größe von MLX-Modellen anhand des tatsächlichen Arbeitsspeichers, Speichers und Chips.
Rund um die Uhr remote verfügbar
Alle Knoten laufen 365 Tage im Jahr zuverlässig. Ihr Team kann per SSH oder VNC zugreifen, und lang laufende Aufgaben werden auch nach dem Abmelden von Teammitgliedern fortgesetzt.
Vom quantisierten Modell zur MLX-API
Validieren Sie das Modell zunächst auf einer festen Konfiguration und kapseln Sie den Inferenzprozess anschließend als Remote-Schnittstelle. Modellpfad, Speichergrenzen, Bind-Adresse und Anfrageprotokolle bleiben nachvollziehbar dokumentiert.
Synchronisieren Sie Modelldateien, fixieren Sie die Versionen von Python, MLX und Projektabhängigkeiten und protokollieren Sie Startparameter sowie Arbeitsverzeichnis.
Verwenden Sie dieselben Prompts, um Spitzenspeicher, Latenz bis zum ersten Token, kontinuierlichen Durchsatz und Ausgabekonsistenz zu vergleichen.
Prüfen Sie Bind-Adresse, Portzugriff, Prozessüberwachung und Fehlerprotokolle, statt nur das Ergebnis eines lokalen Befehlszeilenaufrufs zu testen.
Erweitern Sie lokale Anfragen auf Remote-Aufrufe aus der Anwendung und protokollieren Sie Timeouts, Wiederholungen und Modellwechsel.
- Modellformat
- 4-bit MLX
- Speicheraufzeichnung
- 42.8 / 64 GB
- Bind-Adresse
- 0.0.0.0:8080
- Anfragestatus
- HTTP 200
- API-Endpunkt
- /v1/chat/completions
Beispieldaten zur Veranschaulichung der zu protokollierenden Kennzahlen; keine garantierte Leistung eines bestimmten Modells oder einer bestimmten Konfiguration. Die tatsächliche Leistung hängt von Modell, Quantisierung, Kontextlänge und Parallelität ab.
Erst die Hardware, dann die Mietdauer wählen
Der Einstiegspreis beträgt $19.2/Tag. Alle drei Tarife sind tage-, wochen-, monats- oder quartalsweise mietbar. Jede Bestellung wird ausschließlich in US-Dollar (USD) abgerechnet.
VMKeep M4 Core
M4
16 GB RAM
256 GB SSD
$51.7 / Woche · $95.8 / Monat · $260.6 / Quartal
Geeignet für leichte Xcode-Builds, Automatisierungsskripte, kleine Runner und die Validierung von MLX-Umgebungen. Bei größeren Dependency-Caches oder dauerhaft laufenden Aufgaben sollten Sie zuerst die mittlere Konfiguration vergleichen.
VMKeep M4 Plus
M4
24 GB RAM
512 GB SSD
$106.3 / Woche · $196.9 / Monat · $535.6 / Quartal
Geeignet für kontinuierliche CI, größere Dependency-Caches, React-Native-Builds und die Validierung mittelgroßer MLX-Modelle – ein ausgewogenes Verhältnis aus Kapazität und laufenden Kosten.
VMKeep M4 Pro
M4 Pro
64 GB RAM
2 TB SSD
$164.1 / Woche · $303.8 / Monat · $826.3 / Quartal
Geeignet für speicherintensive MLX-Inferenz, die Evaluierung größerer Modelle, parallele Builds und Workflows mit umfangreichen lokal gespeicherten Modellen oder Build-Artefakten.
Wählen Sie aus fünf Knoten den Standort nahe Ihrem Team oder Ihren Aufrufern
Alle drei Modelle sind in Singapur, Japan (Tokio), Südkorea (Seoul), Hongkong und im Osten der USA verfügbar. Die Kombinationen im Katalog sind in der Regel buchbar; die aktuelle Verfügbarkeit liefert die Konsole in Echtzeit.
Die Latenzbereiche dienen der ersten Standortauswahl. Die tatsächliche Verbindung hängt von Zugriffsstandort, Netzbetreiber und aktueller Route ab. Testen Sie vor der produktiven Anbindung aus dem Netzwerk Ihres Teams.
Die Konsole zeigt Maschinen, Mietdauer, Bestellungen und Verwaltungsaktionen zentral an. Verbindungsmethoden und Prüfpunkte für den ersten Zugriff finden Sie auf der Support-Seite.
Verbindungs- und Migrationshinweise ansehenEignung anhand von Input, Ausführung und Output beurteilen
Cloud-Macs lösen das Problem einer dauerhaft verfügbaren Apple-Silicon-Umgebung mit Remotezugriff. Die tatsächliche Leistung hängt weiterhin von Codeumfang, Modellparametern, Abhängigkeitsstruktur und gewählter Konfiguration ab.
iOS- / macOS-Builds
Organisieren Sie Code, Abhängigkeiten, Xcode-Toolchain und Signaturmaterial in festen Verzeichnissen und führen Sie Tests, Archivierung sowie Prüfungen vor der Veröffentlichung aus.
- Input
- Code, Abhängigkeiten und Signaturkonfiguration
- Ausführung
- xcodebuild und Automatisierungsskripte
- Output
- Testberichte, Protokolle und Archivpakete
Self-hosted Runner
Weisen Sie Repository-Aufgaben dedizierten physischen Knoten zu und planen Sie Arbeitsverzeichnisse, Dependency-Caches, Parallelitätsgrenzen sowie die Reihenfolge von Wiederholungen fehlgeschlagener Aufgaben.
- Input
- Repository-Ereignisse und Pipeline-Aufgaben
- Ausführung
- Dauerhafter Runner und Cache-Verzeichnisse
- Output
- Ausführungsprotokolle, Testergebnisse und Artefakte
MLX-Inferenzexperimente
Vergleichen Sie bei festen Chip- und Speicherbedingungen quantisierte Modellversionen, Spitzenspeicher, Latenz bis zum ersten Token und kontinuierlichen Durchsatz, bevor Sie eine Remote-API kapseln.
- Input
- Modelle, Prompts und Inferenzparameter
- Ausführung
- MLX-Server und Evaluierungsskripte
- Output
- API, Kennzahlen und Modellergebnisse
Remote-Grafikarbeitsplatz
Verarbeiten Sie Befehlszeilenaufgaben über SSH und nutzen Sie die grafische macOS-Oberfläche per VNC – geeignet für kurzfristige Projekte, standortübergreifende Zusammenarbeit und vorübergehende Kapazitätserweiterung.
- Input
- Projektdateien, Toolchain und Assets
- Ausführung
- Remotezugriff über SSH oder VNC
- Output
- Projektdateien, Build-Ergebnisse und Protokolle
Klare Laufzeiten, einheitliche Abrechnung in US-Dollar
Bestätigen Sie bei der Bestellung nacheinander Modell, Knoten, Mietdauer und Zusatzoptionen. Die tatsächliche Verfügbarkeit des Zahlungsgateways gibt die Konsole zurück.
Tage-, wochen-, monats- oder quartalsweise mieten
Für kurzfristige Tests können Sie tage- oder wochenweise starten; für kontinuierliche CI, langfristige Inferenzdienste und feste Remote-Arbeitsumgebungen lohnt sich der Vergleich von Monats- und Quartalsmiete. Prüfen Sie vor der Verlängerung Konfiguration, Knoten, Zeitraum und Datenmigration.
Nur zwei Zahlungsarten verfügbar
Alle Bestellungen werden ausschließlich in US-Dollar (USD) abgerechnet; eine Umrechnung in andere Währungen erfolgt nicht.
Wählen Sie die Konfiguration nach Modellspeicher, Build-Cache und Parallelität; den Knoten nach Standort von Team und Aufrufern; und bestätigen Sie vor Ablauf der Mietdauer den Export der Daten sowie den Widerruf von Tokens und die Entfernung von Schlüsseln.
Maschinentyp, Region und Zahlungsumfang prüfen
Diese Antworten decken die häufigsten Entscheidungsfragen ab. Ausführlichere Informationen zu Konfiguration, Verbindung und Abrechnung finden Sie in den häufigen Fragen.
Bietet VMKeep virtuelle Maschinen an?
Nein. Jede Bestellung umfasst einen dedizierten physischen Mac mini. Die Konfiguration entspricht konkreten Apple-Silicon-, Speicher- und Festplattendaten; dieselbe Laufzeitumgebung wird nicht mit anderen Mietern geteilt.
Kann ich einen MLX-Inferenzserver ausführen?
Ja. Sie können das Modell über die Befehlszeile validieren, anschließend einen Listener starten und die Anwendung über eine API anbinden. Kompatibilität, Speicherbedarf, Latenz bis zum ersten Token und Durchsatz hängen vom konkreten Modell, den Quantisierungsparametern und der gewählten Konfiguration ab.
Welche Regionen sind verfügbar?
Verfügbar sind ausschließlich Singapur, Japan (Tokio), Südkorea (Seoul), Hongkong und der Osten der USA – insgesamt 5 Knoten bzw. Rechenzentren. Alle drei Modelle decken diese 5 Knoten ab.
Welche Zahlungsarten werden unterstützt?
Unterstützt werden ausschließlich USDT-TRC20 sowie Visa / Mastercard / Amex (über Stripe). Alle Beträge werden in US-Dollar (USD) abgerechnet. Welche Gateways aktuell verfügbar sind, zeigt die Konsole.
Wählen Sie einen dauerhaft verfügbaren Cloud-Mac
Wählen Sie eine Konfiguration aus drei dedizierten physischen Apple-Silicon-Macs und bestätigen Sie anschließend Knoten und Mietdauer für Singapur, Tokio, Seoul, Hongkong oder den Osten der USA.