In de snelkookpan van kunstmatige intelligentie is snelheid alles. Together AI, een prominente speler op het gebied van AI-infrastructuur, heeft een indrukwekkende mijlpaal bereikt. Onder leiding van Dan Fu, Vice President of Kernels, slaagt het bedrijf erin om AI-reacties te leveren in minder dan 100 milliseconden. Wat dit extra bijzonder maakt, is dat ze dit combineren met enkele van de laagste tokenkosten in de hele sector. De sleutel tot dit succes? Een intense en slimme samenwerking met de volledige technologische stack van NVIDIA.
De kracht van de 'Megakernel'
De zoektocht naar minimale vertraging (latency) vindt plaats op elk niveau van de AI-infrastructuur. Een van de meest opvallende innovaties van Together AI is de ontwikkeling van een zogenaamde megakernel. Dit stukje softwaretechniek zorgt ervoor dat een volledig AI-model in één enkele NVIDIA CUDA-kernel past. Het resultaat is verbluffend: realtime spraakgestuurde AI-assistenten die hun eerste 64 woorden in een fractie van een seconde op het scherm toveren.
Om deze ongekende schaal en snelheid te bereiken, zet Together AI een breed arsenaal aan NVIDIA-hardware en -software in, waaronder CUDA, TensorRT-LLM en de nieuwste NVIDIA Blackwell-architectuur.
Dynamische aanpassing met ATLAS
Een ander geheim wapen in het arsenaal van Together AI is ATLAS (AdapTive-LeArning Speculator System). Dit systeem is ontworpen om AI-modellen dynamisch aan te passen aan schommelingen in het netwerkverkeer en wisselende werkbelastingen. Fu benadrukt dat de software-stack van NVIDIA—met tools zoals CUDA, CUTLASS, Dynamo en TensorRT-LLM—het absolute fundament vormt van hun complete infrastructuur. Zonder deze diepe integratie zou het optimaliseren van de processen onmogelijk zijn.
Snellere codeerervaring voor Cursor
De vruchten van deze technologie werpen ook direct hun vruchten af voor ontwikkelaars. Together AI hielp de populaire AI-codeerassistent Cursor om de stap van modeloptimalisatie naar productierijpe systemen drastisch te versnellen. Door gebruik te maken van NVIDIA TensorRT-LLM op het Blackwell-platform, beschikt Cursor nu over een razendsnelle en uiterst responsieve interface die programmeurs helpt efficiënter te werken.
Blik op de toekomst: De Vera Rubin-architectuur
Hoewel de huidige prestaties al grensverleggend zijn, kijkt het team van Together AI alweer vooruit. Fu spreekt vol enthousiasme over de aanstormende NVIDIA Vera Rubin-architectuur. Dit platform moet de basis gaan vormen voor een volgende generatie AI-applicaties, die niet alleen nóg sneller zijn, maar ook overweg kunnen met extreem lange en complexe contexten.









