Die RTX 5090 ist brutal schnell – warum überlegen trotzdem immer mehr Leute, für lokale KI einen Mac zu nehmen?

VRam

Wir haben uns jahrelang daran gewöhnt, Hardware aufgrund ihrer Rechenleistung zu beurteilen.

Mehr Prozessorpower – mehr Shader Cores – mehr TOPS – mehr TFLOPS = mehr Speed

Doch bei lokaler KI entsteht gerade ein völlig anderer Flaschenhals:

Wir haben schnelle GPUs – aber die Modelle passen nicht mehr hinein.
Wie in einem Lager, wenn das voll ist nützt auch der schnellste Stapler wenig.

Die aktuelle Highend Grafikkarte von NVIDIA – die RTX 5090 – besitzt beispielsweise 32 GB schnellen GDDR7-Speicher.

Fantastisch für Bildgenerierung, Diffusion, LoRA-Training und Modelle, die vollständig in diesen Speicher passen.

Aber was passiert bei einem großen Vision-Language-Modell, einem 70B-/100B+-LLM oder einer Pipeline aus mehreren Modellen?

Plötzlich werden nicht mehr die Tensor Cores zum Problem.
Bei großen lokalen Modellen wird die verfügbare GPU-Speicherkapazität zunehmend zu einem entscheidenden Flaschenhals.

Die Grafikkarte mit mehr Speicher aufrüsten – funktioniert nicht,
eine RTX 5090 mit 128GB – gibt es aktuell nicht – und wenn wäre sie vermutlich „fast unbezahlbar“.

Unified Memory könnte die Architektur von KI-Workstations verändern

Ein klassischer PC sieht vereinfacht so aus:

CPU → „günstiges“ System-RAM

und separat:

GPU → „teures“ VRAM

Dazwischen liegt der Bus.

Passt das Modell nicht in den VRAM, müssen Daten zwischen System-RAM und GPU-Speicher verschoben werden.
Wie ein Stapler der Kisten von einem Lager in ein anderes umräumt.

Das funktioniert – aber es kann brutal langsam werden!

Apple verfolgt seit Jahren mit den MACs einen anderen Ansatz:

CPU und GPU greifen auf denselben Speicherpool zu.

= Unified Memory.

Und plötzlich entstehen Maschinen, bei denen eine GPU nicht 24 oder 32 GB, sondern 128, 256 oder sogar 512 GB Speicher adressieren kann.

Jetzt beginnen NVIDIA und AMD, genau diese Richtung ebenfalls stärker zu verfolgen.

Die vier aktuell interessanten Architekturen

1. NVIDIA RTX 5090 – extreme Performance

32 GB GDDR7 = Rund 1,8 TB/s Speicherbandbreite

  • CUDA + Tensor Cores + ein großes Ökosystem an optimierte KI-Kernels

Wenn ein Modell vollständig in 32 GB passt, ist diese Architektur schwer zu schlagen.

Für:
• Qwen Image
• FLUX
• Stable Diffusion
• ControlNets
• LoRA-Training
• experimentelle Modelle

ist NVIDIA derzeit häufig die unkomplizierteste Plattform.

Das Problem:

32 GB sind in der heutigen KI-Welt etwas mager.

2. NVIDIA DGX Spark – 128 GB CUDA-Speicher auf dem Schreibtisch

Der DGX Spark geht einen anderen Weg.

NVIDIA kombiniert eine Grace ARM-CPU mit einer Blackwell-GPU und 128 GB kohärentem Unified Memory (LPDDR5x).

CPU und GPU arbeiten damit auf einem gemeinsamen Speicher.

Klingt zunächst wie die perfekte KI-Workstation.
Es gibt allerdings einen gewaltigen Unterschied zur RTX 5090:

Speicherbandbreite: 273 GB/s.
Die RTX 5090 liegt bei ungefähr 1,8 TB/s.

Damit besitzt die 5090 grob die 6,5-fache Speicherbandbreite.

Der DGX Spark ist deshalb keine schnelle 5090 mit mehr RAM.
Sondern ein System mit großem „CUDA-Speicher“ für Modelle, die auf normalen Consumer-GPUs überhaupt nicht mehr hineinpassen.

Quelle: NVIDIA DGX Spark
NVIDIA – DGX Spark Specifications

3. AMD Ryzen AI Max+ 395 – der 128-GB-x86-PC

AMD hat mit „Strix Halo“ etwas gebaut, das auch sehr interessant klingt.

Der Ryzen AI Max+ 395 kombiniert:

• 16 Zen-5-CPU-Kerne
• Radeon 8060S
• 40 GPU Compute Units
• bis zu 128 GB LPDDR5X
• einen gemeinsamen Speicherpool

Und das Ganze läuft auf einem normalen x86-64-System mit Windows oder Linux.

Die AMD Halo Developer Platform erreicht:

128 GB Speicher mit 256 GB/s Speicherbandbreite
Damit liegt sie beim Speicher ungefähr auf DGX-Spark-Niveau – also eher gemächlich.

Der große Unterschied:
Kein CUDA.

AMD verwendet ROCm statt CUDA.
Und genau hier zeigt sich, dass Hardware allein nicht entscheidet.

Ein Projekt mit CUDA-spezifischen Kernels läuft auf NVIDIA häufig sofort.
Bei AMD muss aber die notwendige ROCm-Unterstützung vorhanden sein.

Quelle: AMD
AMD – Ryzen AI Max+ 395 / Halo Platform

4. Apple M5 Ultra – und plötzlich wird es wirklich interessant

Apple legt gut vor und zeigt, dass Unified Memory nicht automatisch langsam sein muss.

Der neue M5 Ultra kann mit bis zu:

512 GB Unified Memory

konfiguriert werden.

Aber die eigentlich bemerkenswerte Zahl ist:

1,2 TB/s Speicherbandbreite.

Damit befindet sich Apple plötzlich in einer völlig anderen Klasse als DGX Spark oder Strix Halo.

Zum Vergleich:

• DGX Spark: 273 GB/s
• Ryzen AI Max+ 395: 256 GB/s
• M5 Ultra: 1.200 GB/s
• RTX 5090: ungefähr 1.800 GB/s

Das bedeutet:

Der M5 Ultra besitzt einen riesigen gemeinsamen Speicherpool – und gleichzeitig eine Speicherbandbreite, die schon deutlich näher an dediziertem High-End-GPU-Speicher liegt.

Apple spricht ausdrücklich davon, Modelle mit Hunderten Milliarden Parametern vollständig lokal ausführen zu können.

Quelle: Apple
Apple – Mac Studio mit M5 Ultra

Das Problem?

Kein CUDA.

Apple verwendet Metal, MPS und MLX.
Gut unterstützte Modelle können darauf hervorragend funktionieren.

CUDA ist viel mehr als ein GPU-Treiber

Warum kann eine RTX 5090 trotz teilweise vergleichbarer Speicherbandbreite bei bestimmten KI-Workloads erheblich schneller sein?
Weil NVIDIA seit Jahren einen kompletten Software Stack optimiert:

Ein moderner KI-Kernel kombiniert mehrere Operationen:

z.B.: MatMul + Bias + Activation – in einem einzigen „fused kernel“.

• Weniger Speicherbewegungen.
• Weniger Overhead.
• Mehr reale Rechenleistung.

Jetzt kommt NVIDIA RTX Spark / N1X

Hier könnte es besonders spannend werden.
NVIDIA hat für Oktober 2026 eine neue RTX-Spark-Klasse angekündigt.
Die größere N1X-Konfiguration soll unter anderem bieten:

• 20-Core Grace CPU
• 6.144-Core NVIDIA Blackwell RTX GPU

und:

• bis zu 128 GB LPDDR5X Unified Memory

Das Ganze soll nicht nur als Entwicklerbox kommen, sondern in Premium-Laptops und kleinen PCs verschiedener Hersteller.

• Asus
• Dell
• HP
• Lenovo
• …

Aber eine wichtige Zahl fehlt momentan noch:

Die Speicherbandbreite!
Denn sie entscheidet darüber, was N1X wirklich wird.

Wenn NVIDIA bei der Speicherbandbreite in Richtung 1 TB/s geht, verändert sich die Situation fundamental.

Dann hätten wir plötzlich:

großen Unified Memory + CUDA + Blackwell + hohe Bandbreite.

Und genau so eine Hardware fehlt heute noch.

Quelle: Nvidia
Nvidia – RTX Spark

Die Frage ist daher nicht mehr unbedingt:

„Wie viele TOPS hat die nächste GPU?“

Sondern eher:

„Wie groß kann mein gesamter Modell- und Kontext-Workload werden, bevor ich zwischen schnellem GPU-Speicher und Systemspeicher verschieben muss?“

Fazit

• RTX 5090 zeigt, wie schnell lokale KI heute sein kann.
• Apple zeigt, wie groß ein schneller gemeinsamer Speicher werden kann.
• DGX Spark zeigt, dass NVIDIA CUDA und Unified Memory zusammenbringen kann.
• AMD zeigt, dass dieses Prinzip auch im normalen x86-PC funktioniert.
• Und N1X könnte zeigen, ob daraus schließlich eine neue Klasse von KI-PCs entsteht.


Teilen & weiterempfehlen

Related Posts