Databricks lisää kilpailun vauhtia Lumihiutale julkaisemalla uuden SQL-pohjaisen tekoälyominaisuuden, joka tulkitsee ja jäsentää dokumentteja automaattisesti. Ominaisuus on osa yrityksen Agent Bricks -raaka-aineita ja yksinkertaistaa PDF-tiedostojen, kuvien ja Office-dokumenttien hallintaa.
Suurin parannus on se, että organisaatiot voivat nyt poimia tekstiä, taulukoita ja kuvia dokumenteista ja tehdä niistä haettavia, analysoitavia ja suoraan integroitavia data-alustaan ilman perinteisiä OCR-työnkulkuja.

Tekoälytoiminto, joka tekee dokumenteista tietokannan luettavia
Uusi funktio on nimeltään ai_parse_document ja se on julkisessa esikatselussa. Se tukee tiedostomuotoja, kuten PDF, JPG, PNG, DOCX ja PPTX. Funktio voi poimia sisältöä spatiaalisten metatietojen kera, mikä tarkoittaa, että alkuperäisen dokumentin asettelu ja rakenne säilyvät myös muuntamisen jälkeen.
Tämä tarkoittaa, että yritykset voivat:
- käsittele asiakirjoja taulukoina
- käytä SQL:ää analyysiin, hakuun ja indeksointiin
- automatisoi jatkuvasti uusia asiakirjoja poimivia prosessia
- integroi sisältö vektorihakuun ja Unity Catalogiin
Yrityksille, jotka ovat aiemmin rakentaneet OCR-työkaluja ja omaa koodiaan, tämä tarkoittaa merkittäviä aika- ja kustannussäästöjä.
Siksi tämä on tärkeää yrityksille
Rakenteeton data on pitkään ollut data-alustojen kompastuskivi. PDF-raportit, kuvat ja esitykset sisältävät arvokasta tietoa, mutta niitä on vaikea käyttää analytiikassa ja tekoälypohjaisissa järjestelmissä. Databricks haluaa muuttaa tämän tekemällä dokumenttien hallinnasta yhtä helppoa kuin tietokantataulukoiden.
Kehitystä vauhdittaa kolme trendiä:
- Tekoälyn natiiveista data-alustoista on tulossa standardi
- SQL-käyttöliittymä yksinkertaistaa käyttöönottoa
- Kustannussäästöt verrattuna monimutkaisiin putkistoihin
Databricks huomauttaa myös, että hinta ja suorituskyky ovat ratkaisevia tekijöitä yrityksille, jotka hallinnoivat miljoonia dokumentteja.

Suora vastaus Snowflaken tekoälypyrkimykseen
Lumihiutale lanseerasi hiljattain omat tekoälyominaisuudet dokumenttien analysointiin nimellä Agentic Document Analytics. Molemmat yritykset tarjoavat samankaltaisia työkaluja, mutta Databricks painottaa erityisesti kustannushyötyjä ja puhdasta SQL-työnkulkua.
Analyytikot uskovat, että Databricks Tämä ratkaisu vähentää manuaalisten integraatioiden tarvetta ja sopii yrityksille, jotka jo toimivat SQL-pohjaisesti.
Vaikutukset pohjoismaisiin IT-yrityksiin
Pohjoismaisille IT-alan toimijoille tämä kehitys tarkoittaa useita etuja:
1. Tehokkaampi dokumenttienhallinta
Tekniset tiedot, raportit ja PDF-raportit jäsennetään ja niistä tulee automaattisesti haettavia.
2. Uudet analyysimahdollisuudet
Aiemmin PDF-tiedostoihin lukitut tiedot voidaan integroida koontinäyttöihin ja BI-työkaluihin.
3. Alemmat kehityskustannukset
Vähemmän tarvetta OCR-työkaluille ja mukautetulle koodille.
4. Vahvemmat tekoälyvirrat
RAG, chatbotit, hakukoneet ja sisäiset tietokannat saavat paremman tuen.
5. Kilpailun lisääntyminen data-alustojen kilpailussa
Valinta Snowflaken ja Databricksin välillä muuttuu entistä strategisemmaksi ja tekoälykeskeisemmäksi.
Johtopäätös
Databricks SQL-pohjainen tekoälyyn perustuva dokumenttianalyysi on askel kohti seuraavan sukupolven data-alustoja. Rakenteellisen ja strukturoimattoman datan raja hämärtyy, ja yrityksillä on täysin uusia mahdollisuuksia hyödyntää dokumentteja ja tiedostoja data- ja tekoälytyössään.
Lanseeraus vahvistaa myös kilpailua Snowflaken kanssa ja vaikuttaa siihen, miten pohjoismaiset yritykset valitsevat data-alustoja tulevaisuudessa.








