Bild: KI-generiertAlibaba Cloud setzt verstärkt auf eigene KI-Chips
Alibaba Cloud will mehr selbst entwickelte Chips einsetzen und damit die Amortisationszeit seiner KI-Server von drei auf 2,5 Jahre verkürzen. Für Unternehmenskunden steigen damit neben dem Preisdruck auch die Risiken durch proprietäre Cloud-Infrastruktur und Vendor-Lock-in.
Bild: KI-generiertGoogle KI-Chips: Marvell ergänzt Broadcom
Google erweitert die Entwicklung seiner KI-Chips und beauftragt neben Broadcom künftig auch Marvell mit Custom-Silicon für das TPU-Ökosystem. Ein Optionsschein über knapp 59 Millionen Marvell-Aktien unterstreicht die Größenordnung der Zusammenarbeit, seine Ausübung bleibt jedoch offen.
Bild: KI-generiertCerebras CS-4 schafft 4.400 Token pro Sekunde
Cerebras verdoppelt mit dem WSE-3T die Rechenleistung und Speicherbandbreite seines Wafer-Beschleunigers. Das modulare CS-4-System soll bei gpt-oss-120b bis zu 4.400 Token pro Sekunde und Nutzer erreichen, stellt Rechenzentren aber vor hohe Anforderungen bei Stromversorgung und Kühlung.
Bild: KI-generiertOpenAI Ultrafast: GPT-5.6 Sol 14-mal schneller
OpenAI hat eine neue API-Leistungsstufe namens Ultrafast angekündigt, die das Spitzenmodell GPT-5.6 Sol bis zu 14-mal schneller ausführt und bis zu 750 Output-Tokens pro Sekunde liefert. Möglich macht das Spezialhardware von Cerebras. Der Modus läuft zunächst als begrenzte Vorschau für ausgewählte Kunden, Preise und Verfügbarkeitstermine nennt OpenAI nicht.
Bild: KI-generiertRAM-Engpass: Speicherkapazität für 2027 ausverkauft
Einem Bericht zufolge haben Samsung, SK Hynix und Micron ihre komplette DRAM- und HBM-Produktion für 2027 an KI-Unternehmen vergeben, teils über Abnahmeverträge mit fünf Jahren Laufzeit. Bestätigt haben die Hersteller das bislang nicht. Für Unternehmen, die eigene Server statt Cloud-Abos betreiben wollen, steigen damit die Anschaffungskosten spürbar.
Bild: KI-generiertAMD kauft Taalas: KI-Modelle direkt im Silizium
AMD übernimmt das Toronto-Startup Taalas, das die Gewichte von KI-Modellen fest in Chips ätzt statt sie aus Speicher zu laden. Ein Testchip lieferte mit Llama 3.1 8B knapp 17.000 Token pro Sekunde. Der Preis dafür ist eine harte Bindung an genau ein Modell.