In Kürze

  • DeepSeek hat DeepSpec veröffentlicht, einen vollständigen Trainings- und Auswertungs-Stack für spekulatives Dekodieren, der drei Entwurfsmodell-Algorithmen (DSpark, DFlash und Eagle3) sowie Skripte zur Datenvorbereitung, mehrstufige GPU-Trainingspipelines und Auswertungen über neun Benchmarks umfasst; der Code steht unter der MIT-Lizenz.
  • Beim spekulativen Dekodieren schlägt ein kleines, schnelles «Entwurfsmodell» mehrere mögliche nächste Textbausteine vor, die das grosse Zielmodell danach gebündelt in einem Rechenschritt bestätigt statt Wort für Wort neu zu berechnen, was die Antwortzeit spürbar senkt, ohne die Ausgabequalität zu verändern.
  • In der von DeepSeek eingesetzten Konfiguration «DSpark-5» steigt die Generierungsgeschwindigkeit pro Nutzerin und Nutzer laut eigenen Angaben um 60 bis 85 Prozent bei DeepSeek-V4-Flash und um 57 bis 78 Prozent bei DeepSeek-V4-Pro; die Kosten pro Million Ausgabetoken sollen dadurch um bis zu rund 40 Prozent sinken, sofern die zusätzliche Kapazität auch durch entsprechende Nachfrage ausgelastet wird.

Was ist passiert?

DeepSeek hat mit DeepSpec einen vollständigen Trainings- und Auswertungs-Stack für spekulatives Dekodieren veröffentlicht und den Code unter der MIT-Lizenz auf GitHub frei zugänglich gemacht. Das Paket enthält drei unterschiedliche Entwurfsmodell-Algorithmen – DSpark, DFlash und Eagle3 –, dazu Werkzeuge zur Datenvorbereitung, mehrstufige Trainingspipelines für mehrere Grafikprozessoren und Auswertungsskripte über neun verschiedene Benchmarks. Anders als bei früheren Veröffentlichungen, bei denen DeepSeek lediglich fertige Modellgewichte teilte, gibt das Unternehmen mit DeepSpec diesmal die komplette Trainingsmaschinerie frei, mit der Entwicklerinnen und Entwickler eigene, auf ihre Infrastruktur zugeschnittene Entwurfsmodelle trainieren können.

Spekulatives Dekodieren nutzt ein kleines, schnelles Entwurfsmodell, das mehrere mögliche nächste Textbausteine vorschlägt; das grosse, eigentliche Zielmodell prüft diese Vorschläge anschliessend gebündelt in einem einzigen Rechenschritt, statt jedes Wort einzeln neu zu berechnen. Fällt die Vorhersage des Entwurfsmodells zutreffend aus, sinkt die für eine Antwort benötigte Rechenzeit spürbar, ohne dass sich an der Qualität der Ausgabe etwas ändert – vorausgesetzt, das Entwurfsmodell ist laut Fachanalysen etwa 10- bis 30-mal schneller als das Zielmodell.

Warum ist das wichtig?

In der von DeepSeek selbst eingesetzten Konfiguration namens «DSpark-5» steigt die Generierungsgeschwindigkeit pro Nutzerin und Nutzer laut Unternehmensangaben um 60 bis 85 Prozent beim Modell DeepSeek-V4-Flash und um 57 bis 78 Prozent beim leistungsstärkeren DeepSeek-V4-Pro. In der Praxis kann das die Kosten pro Million Ausgabetoken laut Fachmedienberichten von rund 1,73 auf 1,04 US-Dollar senken, eine Reduktion von rund 40 Prozent – vorausgesetzt, die zusätzlich freiwerdende Rechenkapazität wird auch durch entsprechende Nachfrage ausgelastet.

Die Veröffentlichung reiht sich in ein wiederkehrendes Muster ein: DeepSeek macht regelmässig Effizienzverbesserungen bei der Modell-Inferenz quelloffen und erhöht damit den Preisdruck auf proprietäre Anbieter, deren vergleichbare Optimierungen meist unternehmensintern bleiben. Für Teams, die bereits mit offenen Modellen wie Qwen3 oder Gemma arbeiten, bietet DeepSpec laut Fachanalysen einen direkten Weg zu schnellerer Inferenz, ohne das zugrunde liegende Basismodell neu trainieren zu müssen – mit dem Hinweis, dass die Standardkonfiguration mit 38 Terabyte Speicherbedarf und einem Achtfach-GPU-Setup vor allem für gut ausgestattete Teams unmittelbar praktikabel ist.

Was bedeutet das für die Schweiz?

Redaktionelle Einordnung: Die folgenden Schlussfolgerungen beziehen sich auf die genannten Quellen. Sie sind keine zusätzlichen Meldungen der Originalquelle.

  • Für Schweizer Software- und KMU-Dienstleister, die eigene KI-Anwendungen auf Basis offener Modelle wie Qwen oder Gemma betreiben, senkt ein quelloffener, vollständiger Trainings-Stack für spekulatives Dekodieren die Einstiegshürde, um eigene, auf die jeweilige Infrastruktur zugeschnittene Entwurfsmodelle zu trainieren, statt allein auf fertige Gewichte einzelner Anbieter angewiesen zu sein.
  • Tiefere Inferenzkosten bei offenen Modellen erhöhen für Schweizer Unternehmen den wirtschaftlichen Druck, ihre bestehende Wahl zwischen proprietären US-Anbietern und offenen, oft chinesischen oder europäischen Modellen wie Apertus aus Sicht von Kosten, Datenschutz und digitaler Souveränität neu zu bewerten.
  • Wer chinesische Modelle oder darauf abgestimmte Werkzeuge wie DeepSpec im eigenen Betrieb einsetzt, muss weiterhin die Anforderungen des Datenschutzgesetzes (DSG) zu Auftragsbearbeitung, Datenstandort und Drittstaatentransfer beachten, unabhängig davon, dass der zugrunde liegende Code offen einsehbar ist.

Verwendete Quellen

DeepSeek veröffentlichte Code, Trainingspipeline und technischen Bericht zu DeepSpec im eigenen GitHub-Repository; Fachmedien wie AI Weekly und Computing.co.uk ordneten die gemessenen Effizienzgewinne zusätzlich ein.

Quellenstatus: 1 verlinkte Quelle · 0 von 1 Originaldaten verifiziert. Prüfregeln ansehen

Häufige Fragen

Was ist die Kernaussage zu DeepSeek macht Inferenz-Beschleuniger DeepSpec quelloffen?

DeepSeek hat DeepSpec veröffentlicht, einen vollständigen Trainings- und Auswertungs-Stack für spekulatives Dekodieren, der drei Entwurfsmodell-Algorithmen (DSpark, DFlash und Eagle3) sowie Skripte zur Datenvorbereitung, mehrstufige GPU-Trainingspipelines und Auswertungen über neun Benchmarks umfasst; der Code steht unter der MIT-Lizenz.

Warum ist diese KI-Meldung für die Schweiz relevant?

Für Schweizer Software- und KMU-Dienstleister, die eigene KI-Anwendungen auf Basis offener Modelle wie Qwen oder Gemma betreiben, senkt ein quelloffener, vollständiger Trainings-Stack für spekulatives Dekodieren die Einstiegshürde, um eigene, auf die jeweilige Infrastruktur zugeschnittene Entwurfsmodelle zu trainieren, statt allein auf fertige Gewichte einzelner Anbieter angewiesen zu sein.

Welche Quelle nutzt KI News Schweiz für diese Einordnung?

DeepSeek veröffentlichte Code, Trainingspipeline und technischen Bericht zu DeepSpec im eigenen GitHub-Repository; Fachmedien wie AI Weekly und Computing.co.uk ordneten die gemessenen Effizienzgewinne zusätzlich ein.