Amazon Web Services utökar Aurora PostgreSQL med möjligheten att direkt analysera data i Apache Iceberg och Parquet. Genom att integrera DuckDB i databasmotorn vill AWS göra det enklare att kombinera operativ data med stora datamängder i datalakes, utan traditionella ETL-flöden.
AWS fortsätter att föra databaser, analys och AI närmare varandra. Den senaste nyheten innebär att Amazon Aurora PostgreSQL nu kan fråga data som lagras i Apache Iceberg- och Parquet-format direkt från databasen.
Organisationer kan därmed kombinera aktuell operativ information i Aurora med historisk och analytisk data i sina datalakes utan att först behöva flytta informationen till ett separat analyssystem.
DuckDB byggs in i Aurora PostgreSQL
En central del av den nya funktionen är DuckDB, den populära analytiska databasmotorn som är optimerad för OLAP-arbetsbelastningar.
AWS har integrerat DuckDB direkt i Aurora PostgreSQL.
När en fråga omfattar extern Iceberg- eller Parquet-data kan Aurora använda DuckDB för att genomföra den analytiska bearbetningen, samtidigt som användaren fortsätter arbeta genom PostgreSQL.
Det innebär att organisationer kan använda välbekanta SQL-verktyg och PostgreSQL-kompatibla applikationer för analyser som kombinerar flera olika datakällor.
Mindre behov av komplexa ETL-flöden
Traditionellt har organisationer ofta behövt använda ETL-processer, Extract, Transform, Load, för att flytta information mellan operativa databaser och analytiska dataplattformar.
Sådana arkitekturer kan innebära ytterligare infrastruktur, datakopior och komplexitet.
Med den nya Aurora-funktionen kan frågor i stället köras direkt mot information som redan finns i en datalake.
AWS beskriver möjligheten som ett sätt att minska behovet av att flytta och duplicera data enbart för analys.
Stöd för Apache Iceberg och Parquet
Aurora PostgreSQL kan med den nya funktionen arbeta direkt med data lagrad i Apache Iceberg och Apache Parquet.
Stödet omfattar bland annat data i Amazon S3, Amazon S3 Tables och kataloginformation från AWS Glue Data Catalog.
AWS har även stöd för externa kataloger som är kompatibla med Iceberg REST Catalog.
Det gör det möjligt för organisationer att bygga arkitekturer där samma data kan användas av flera analys-, databas- och AI-tjänster utan att informationen behöver kopieras mellan varje system.
AWS lyfter AI-agenter som användningsområde
Ett av de användningsområden AWS pekar ut är AI-agenter.
Agentbaserade AI-system behöver ofta tillgång till flera typer av information samtidigt. Det kan exempelvis handla om aktuell information om kunder, transaktioner eller lager tillsammans med historiska data som lagras i en datalake.
Genom att låta Aurora kombinera dessa datakällor i samma SQL-fråga kan applikationer och AI-agenter få tillgång till både operativ och historisk information genom ett gemensamt gränssnitt.
Det kan minska behovet av separata integrationslager mellan AI-applikationen och organisationens olika dataplattformar.
Operativ och analytisk data i samma fråga
En organisation skulle exempelvis kunna ha aktuell orderinformation i Aurora PostgreSQL samtidigt som flera års historiska försäljningsdata finns lagrad som Iceberg-tabeller i Amazon S3.
Med den nya funktionen kan information från båda miljöerna kombineras direkt i en SQL-fråga.
Det öppnar bland annat för analyser där organisationer vill jämföra aktuella händelser med historiska mönster utan att först bygga en separat datapipeline.
Tillgängligt för Aurora PostgreSQL 17.11 och 18.6
Direktfrågor mot Apache Iceberg och Parquet är tillgängliga med Amazon Aurora PostgreSQL 17.11 och 18.6.
AWS uppger att funktionen finns tillgänglig i kommersiella AWS-regioner samt AWS GovCloud-regioner där dessa Aurora-versioner erbjuds.
Det tas ingen separat avgift för själva funktionen. Organisationer betalar däremot för underliggande resurser, exempelvis Aurora-kapacitet och förfrågningar mot Amazon S3.
Dataarkitekturen förändras när AI får större roll
Lanseringen illustrerar samtidigt en större förändring inom företagens datainfrastruktur.
Gränserna mellan transaktionsdatabaser, datalakes, analysplattformar och AI-system blir allt mindre tydliga när organisationer vill använda samma information för flera olika arbetsbelastningar.
För företag som bygger generativa AI-lösningar eller autonoma AI-agenter blir tillgången till aktuell och historisk information särskilt viktig.
Genom att föra analytisk bearbetning närmare Aurora försöker AWS minska antalet steg mellan företagens operativa data och de analys- och AI-applikationer som behöver använda den.