3 Minuten
Stel je een serverchip voor die niet alleen een model uitvoert, maar ook subtiel het ontwerp volgt. Ingenieurs bij Google bouwen dat stilletjes: een serverversneller met codenaam Frozen v2 die delen van de Gemini-architectuur in silicium vastlegt, met het oog op aanzienlijk hogere efficiëntie en lagere latentie.
De informatie komt uit een rapport in The Information met verwijzing naar twee insiders. Hun bewering is opvallend: Frozen v2 zou zes tot tien keer meer tokens per watt kunnen verwerken dan Googles laatste tensorverwerkingsunits. De streefdatum? 2028. De motivatie is duidelijk en bekend voor wie ziet dat de cloudvraag de capaciteit overtreft. Google Cloud zou naar verluidt enkele klantdeals hebben geweigerd vanwege een knelpunt in AI-verwerking.
Architectuur inbouwen in plaats van regels
Traditionele TPU's en GPU's zijn generalisten. Je laadt een model en de hardware neemt veel runtime-beslissingen: hoe data te verplaatsen, welke bewerkingen te plannen, wanneer geheugen op te halen. Die flexibiliteit is krachtig. Maar ze brengt overhead met zich mee. Frozen v2 kiest een andere koers: het verankert bepaalde Gemini-specifieke beslissingen in de transistorlogica. Het resultaat is minder uitvoeringsstappen en minder data die per verzoek wordt verplaatst. Minder beweging. Minder overhead. Lagere latentie. Nieuwe realtime-toepassingen worden haalbaar.

Er lag nog een gedurfder idee op tafel. Vroege Frozen-ontwerpen onder leiding van Jeff Dean zouden hebben geprobeerd modelgewichten rechtstreeks in silicium vast te leggen. Dat zou een radicale optimalisatie zijn. Het zou ook snel verouderen, want chips die aan één modelversie zijn gebonden hebben een zeer korte nuttige levensduur. Google koos voor een middenweg. Frozen v2 zou het architectuurskelet inbedden terwijl de gewichten bijwerkbaar blijven, zodat dezelfde chip meerdere Gemini-releases kan bedienen zolang ze dezelfde architectuurpatronen volgen.
Deze aanpak kan reactietijden voldoende verkorten om nieuwe klassen interactieve en lage-latentie AI-toepassingen mogelijk te maken.
Google is niet van plan zijn TPU-vloot te vervangen door Frozen v2. Zie het als een experimentele baan die naast de TPU-productie draait, een testomgeving voor meer gespecialiseerde siliconen terwijl modelontwerpen stabiliseren. De TPU-productroadmap zelf scheidde onlangs trainings- en inferentiebehoeften met chips van de achtste generatie die in april op het Cloud Next-evenement werden aangekondigd. Het Frozen v2-initiatief is kleinschaliger; Google plant geen massaproductie op het niveau van TPUs.
De verwachte komst van Frozen v2 valt ook samen met andere bewegingen in de branche. Google zou Intel hebben gecontracteerd om tegen 2028 meer dan drie miljoen TPU-chips te verpakken. Ondertussen verkennen startups en concurrenten al modelbewuste siliconen. Het in Toronto gevestigde Taalas bracht zijn HC1-chip uit, gecombineerd met Llama 3.1 8B, en zegt 17.000 tokens per seconde te halen zonder on-package HBM. De startup haalde ongeveer €186 miljoen aan financiering op. En vorig jaar tekende Nvidia een technologielicentieovereenkomst met Groq ter waarde van ongeveer €18,6 miljard, een bewijs dat de markt grote waarde ziet in het integreren van modelgedrag en hardware.
Er zijn compromissen. Het inbedden van architectuur vermindert sommige vormen van flexibiliteit. Het bevoordeelt use-cases waarin modelfamilies consistent blijven in de tijd. Het verschuift ook de productlevenscyclus: silicium ontworpen rond een modelarchitectuur moet gerechtvaardigd worden door voorspelbare ontwerpstabiliteit en inzetvolume. Dat verklaart Googles terughoudende houding. Frozen v2 is experimenteel; niet elk experiment wordt een product.
Voorlopig heeft Google Frozen v2 niet publiekelijk bevestigd. Een woordvoerder herinnerde The Information eraan dat veel interne projecten nooit productie halen. Toch is het basale idee om enige modellogica in silicium te verplaatsen om energie te besparen en latentie te verminderen, gevorderd van academische nieuwsgierigheid tot competitieve strategie. Verwacht dat meer bedrijven vergelijkbare mengvormen van modelbewuste hardware en bijwerkbare gewichten zullen testen naarmate de vraag naar efficiënte, lage-latentie AI blijft stijgen.
.webp)




Laat een reactie achter
Reacties
Nog geen reacties. Wees de eerste.