AI op topsnelheid: Hoe Together AI de 100ms-grens doorbreekt met NVIDIA

AI op topsnelheid: Hoe Together AI de 100ms-grens doorbreekt met NVIDIA

In de snelkookpan van kunstmatige intelligentie is snelheid alles. Together AI, een prominente speler op het gebied van AI-infrastructuur, heeft een indrukwekkende mijlpaal bereikt. Onder leiding van Dan Fu, Vice President of Kernels, slaagt het bedrijf erin om AI-reacties te leveren in minder dan 100 milliseconden. Wat dit extra bijzonder maakt, is dat ze dit combineren met enkele van de laagste tokenkosten in de hele sector. De sleutel tot dit succes? Een intense en slimme samenwerking met de volledige technologische stack van NVIDIA.

De kracht van de 'Megakernel'

De zoektocht naar minimale vertraging (latency) vindt plaats op elk niveau van de AI-infrastructuur. Een van de meest opvallende innovaties van Together AI is de ontwikkeling van een zogenaamde megakernel. Dit stukje softwaretechniek zorgt ervoor dat een volledig AI-model in één enkele NVIDIA CUDA-kernel past. Het resultaat is verbluffend: realtime spraakgestuurde AI-assistenten die hun eerste 64 woorden in een fractie van een seconde op het scherm toveren.

How Together AI Uses NVIDIA's Full Stack to Deliver AI Responses in Under 100ms
Om deze ongekende schaal en snelheid te bereiken, zet Together AI een breed arsenaal aan NVIDIA-hardware en -software in, waaronder CUDA, TensorRT-LLM en de nieuwste NVIDIA Blackwell-architectuur.

Dynamische aanpassing met ATLAS

Een ander geheim wapen in het arsenaal van Together AI is ATLAS (AdapTive-LeArning Speculator System). Dit systeem is ontworpen om AI-modellen dynamisch aan te passen aan schommelingen in het netwerkverkeer en wisselende werkbelastingen. Fu benadrukt dat de software-stack van NVIDIA—met tools zoals CUDA, CUTLASS, Dynamo en TensorRT-LLM—het absolute fundament vormt van hun complete infrastructuur. Zonder deze diepe integratie zou het optimaliseren van de processen onmogelijk zijn.

Snellere codeerervaring voor Cursor

De vruchten van deze technologie werpen ook direct hun vruchten af voor ontwikkelaars. Together AI hielp de populaire AI-codeerassistent Cursor om de stap van modeloptimalisatie naar productierijpe systemen drastisch te versnellen. Door gebruik te maken van NVIDIA TensorRT-LLM op het Blackwell-platform, beschikt Cursor nu over een razendsnelle en uiterst responsieve interface die programmeurs helpt efficiënter te werken.


Blik op de toekomst: De Vera Rubin-architectuur

Hoewel de huidige prestaties al grensverleggend zijn, kijkt het team van Together AI alweer vooruit. Fu spreekt vol enthousiasme over de aanstormende NVIDIA Vera Rubin-architectuur. Dit platform moet de basis gaan vormen voor een volgende generatie AI-applicaties, die niet alleen nóg sneller zijn, maar ook overweg kunnen met extreem lange en complexe contexten.

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak