NetApp lanserar Novus, en ny dataarkitektur utvecklad för storskaliga AI-fabriker och GPU-miljöer. Arkitekturen är konstruerad för att överstiga 100 TB/s i sammanlagd genomströmning och ska minska risken för att lagringen blir flaskhalsen när företag skalar upp sin AI-infrastruktur.
AI-utvecklingen driver fram en ny generation datacenter där tiotusentals, och i vissa fall hundratusentals, GPU behöver matas med enorma mängder data.
Men kraftfulla GPU-kluster löser bara en del av problemet.
Om lagringssystemen inte kan leverera data tillräckligt snabbt riskerar dyr GPU-kapacitet att stå outnyttjad.
Det är den utmaningen NetApp vill angripa med sin nya arkitektur NetApp Novus.
Novus utvecklas för AI-fabriker
Novus är byggd för mycket stora AI-miljöer, exempelvis AI-fabriker, neocloud-operatörer, hyperscalers, stora företags GPU-moln och leverantörer av GPU-as-a-Service.
NetApp beskriver arkitekturen som utvecklad specifikt för den skala och samtidighet som moderna AI-arbetsbelastningar kräver.
Arkitekturen är byggd på NetApps ONTAP-plattform och konstruerad för att kunna leverera mer än 100 TB/s i sammanlagd genomströmning.
NetApp uppger dessutom att arkitekturen är utvecklad för filsystem i zettabyte-skala.
Metadata separeras från själva datatrafiken
En central del av Novus är att metadata och data separeras.
I traditionella lagringsarkitekturer kan metadataoperationer och stora sekventiella dataöverföringar konkurrera om samma resurser.
Det kan bli särskilt problematiskt i AI-miljöer där systemen samtidigt behöver hantera enorma mängder filer och kontinuerligt leverera stora datamängder till GPU-kluster.
Novus separerar därför metadata från dataplanet.
Det gör det möjligt att skala metadata, bandbredd och kapacitet oberoende av varandra, samtidigt som informationen fortfarande hanteras inom ett gemensamt namespace.
Målet är att hålla GPU sysselsatta
För operatörer av stora AI-miljöer handlar lagringsprestanda inte enbart om hur snabbt data kan läsas.
Det handlar även om hur effektivt organisationen kan använda sina investeringar i GPU-infrastruktur.
NetApps ambition med Novus är att minska lagringsrelaterade flaskhalsar och kontinuerligt förse GPU med den data som krävs för exempelvis AI-träning och andra dataintensiva arbetsbelastningar.
Företaget uppger att arkitekturen är utformad för att stödja hög nyttjandegrad för hundratusentals GPU.
NetApp samarbetar med Supermicro
Den första implementationen av Novus kombinerar NetApp Novus Data Director med kvalificerad serverinfrastruktur från Supermicro.
Data Director hanterar metadata, medan NetApps AFF A90-system och ONTAP står för det högpresterande datalagret.
Genom att separera de två planen kan organisationer enligt NetApp skala beräkningskapacitet och dataresurser mer oberoende när AI-miljöerna växer.
Samarbetet med Supermicro är samtidigt bredare än Novus.
Företagen arbetar även med gemensamt validerade infrastrukturlösningar för bland annat enterprise AI, neocloud, sovereign AI och storskaliga AI-fabriker.
Gemensam AI-plattform för företag
NetApp och Supermicro samarbetar dessutom kring NetApp AIPod with Supermicro, en validerad konvergerad infrastruktur baserad på Nvidias referensarkitektur.
Lösningen riktar sig mot företag som vill bygga privata AI-plattformar för bland annat träning, inferens och agentiska AI-arbetsbelastningar.
Här handlar skalan om miljöer från ett mindre antal GPU upp till hundratals GPU, snarare än de betydligt större AI-fabriker som Novus är utvecklad för.
AI förändrar kraven på lagring
Lanseringen visar hur AI-boomen börjar förändra konkurrensen inom enterprise storage.
Under de senaste åren har mycket av diskussionen kring AI-infrastruktur fokuserat på GPU, acceleratorer och nätverk. När AI-kluster växer blir dock även datalagret en allt viktigare del av ekvationen.
Stora språkmodeller och andra AI-arbetsbelastningar behöver kontinuerligt bearbeta stora mängder data, samtidigt som infrastrukturen måste hantera metadata, checkpoints och stora mängder filer.
Det ställer andra krav än många traditionella enterprise-arbetsbelastningar.
NetApp positionerar lagring som en del av AI-fabriken
Med Novus försöker NetApp därför flytta diskussionen om AI-infrastruktur från enbart beräkningskapacitet till hur hela dataflödet fungerar.
För företag som investerar stora belopp i GPU-kluster kan även relativt små effektivitetsförluster bli kostsamma när infrastrukturen skalas upp.
NetApps satsning visar samtidigt hur lagringsmarknaden utvecklas i takt med att AI flyttar från experiment och pilotprojekt till betydligt större produktionsmiljöer.
När AI-fabriker fortsätter växa blir frågan därför inte bara hur många GPU en organisation kan installera, utan hur effektivt infrastrukturen kan hålla dem försedda med rätt data.