Een aangepaste AI-RAG maken vanuit een Google Sheet

Stel dat een organisatie AI-toepassingen wil bouwen op basis van eigen data, maar geen expertise heeft op het gebied van databases, API's of grote taalmodellen (LLM's). Een eenvoudige oplossing is om een kopie van die data te maken in een 'schaduw'-database met tools als Google Sheets, Notion of Airtable.
Vervolgens kan deze database zonder programmeerwerk worden gekoppeld aan een LLM. In dit voorbeeld koppelen we een (live) Google Sheet aan een LLM. De relaties zijn als volgt:

Inleiding
Bij het experimenteren met taakspecifieke LLM's en agentische toepassingen is het beschikken over relevante brondata essentieel. Daarbij geldt:
Privacy: privacygevoelige data moet onder controle van de organisatie blijven. Bij twijfel over waar en hoe de data wordt opgeslagen en gebruikt, is het raadzaam de data te anonimiseren.
Dynamische updates: de data die voor een bedrijf het meest relevant is, wordt doorgaans regelmatig bijgewerkt, wat het opzetten van een live schaduwdatabase rechtvaardigt in plaats van het gebruik van data-exports. De workflow in deze demo kan zowel live data als data-exports verwerken.
Voor innovatieteams die experimenteren met AI-toepassingen kan het opzetten van no-code 'schaduw'-databases waardevol zijn. Met deze databases kunnen teams hun eigen data bevragen en erop voortbouwen. Door kleine proofs-of-concept of proofs-of-technology te ontwikkelen, kunnen organisaties toekomstige investeringen in enterprise-applicaties en agents beter onderbouwen. In deze blog laat ik zien hoe een eenvoudige 'lekendatabase' te maken is die via een no-code oplossing wordt gekoppeld aan een LLM. De stappen zijn als volgt:
Kies een platform zoals Google Sheets, Airtable of Notion. (In dit voorbeeld wordt Google Sheets gebruikt.)
Maak een API (JSON) met behulp van een externe dienst (Sheety).
Zet een workflow op met DataStax - LangFlow (low-code/no-code).
Begin direct met het bevragen van en werken met de eigen data van de organisatie.
Achtergrond
Large Language Models (LLM's) worden getraind op vaste datasets en bevatten mogelijk niet de meest actuele informatie of specifieke details over nicheonderwerpen. Om LLM's bruikbaar te maken in een zakelijke context, hebben ze toegang nodig tot gedetailleerde, specifieke en regelmatig bijgewerkte data.
Dat is waar Generatie met opgehaalde context (Retrieval Augmented Generation, RAG) om de hoek komt kijken. RAG stelt LLM's in staat om relevante informatie op te halen uit externe bronnen, zoals documenten, afbeeldingen of databases, en die als context in prompts te gebruiken. Deze aanpak verbetert de antwoorden van het model doordat ze nauwkeuriger en contextueel relevanter worden.
Om deze informatie efficiënt op te halen, maakt RAG vaak gebruik van een vectoropslag of vectordatabase. Deze databases slaan data (tekst, afbeeldingen, enzovoort) op als numerieke embeddings (vectoren) die de betekenis ervan weergeven. Bij een zoekopdracht vindt de vectordatabase de meest relevante items door embeddings te vergelijken, zodat het LLM over de juiste context beschikt om betere antwoorden te genereren.
Stap 1: een API maken
Eerst moeten we onze Google Sheet omzetten in een database die kan `praten`. Met platforms als Sheetly (bron) kan er een API voor de sheet worden gegenereerd, inclusief authenticatie.

Stap 2: een workflow opzetten
Met een platform als Datastax is het mogelijk om vanuit een template te werken waarin de meeste essentiële stappen al voorgeprogrammeerd zijn. Omdat we data willen laden en willen 'toevoegen' aan de kennis van het LLM, kiezen we de template Vectoropslag-RAG.

In de template-workflow zitten twee workflows:
De Load Data-workflow: deze workflow laadt de data en maakt een Vector Search mogelijk. In de template is de data-upload momenteel een bestandsupload, maar dat gaan we veranderen in een API Request.
De Retriever-workflow: deze workflow verbindt de front-end chatinterface met de ‘eigen’ database. Deze workflow laat zien dat er gezocht moet worden in dezelfde Database en Collection die in de workflow voor het laden van data zijn gevuld.
Stap 3: workflow en parameters aanpassen
De volledige workflow ziet er als volgt uit:






Via de Playground rechtsboven is het nu mogelijk om te chatten met de eigen database van de organisatie.
Mijn Google Sheet-database bevat meer dan 150.000 records van Spotify-tracks, compleet met gedetailleerde variabelen zoals tracknaam, artiest, populariteit, genre en meer. Om te laten zien hoe deze opzet werkt, stelde ik het systeem de vraag: “Wat zijn de meeste tracks die iets met een bloem te maken hebben? Geef 10 voorbeelden.”
Het LLM interpreteerde de context van de vraag, zocht naar associaties met bloemen en bevroeg de database dienovereenkomstig. Dit voorbeeld laat zien hoe het systeem natuurlijk taalbegrip combineert met nauwkeurige gegevensopvraging, waardoor het een krachtig hulpmiddel wordt om grote datasets te verkennen zonder complexe query's of technische expertise..

Tot slot
Google Sheets biedt een eenvoudige en toegankelijke manier om te beginnen met het opzetten van schaduwdatabases voor AI-experimenten. Tools als Notion en Airtable breiden deze functionaliteit verder uit doordat er ook pdf's en andere documenten aan toegevoegd kunnen worden, wat ze tot krachtige alternatieven maakt voor complexere datasets. Met platforms als DataStax kunnen teams hun eigen applicaties publiceren, waardoor het proces om experimentele workflows om te zetten in tastbare resultaten wordt gestroomlijnd.
In een volgende blog laat ik zien hoe vergelijkbare workflows ingezet kunnen worden om AI-agents te bouwen die onderzoek en analyses uitvoeren op concurrenten.
Dezelfde principes van LLM's en RAG's die in deze gids worden beschreven, zijn toepasbaar op complexere enterprise-oplossingen. Eli5 benut deze methoden zodat wij op maat gemaakte AI-applicaties en -agents kunnen bouwen die naadloos samenwerken met de eigen data, wat nieuwe kansen opent voor innovatie en operationele efficiëntie.
De eerste stap naar uw modernisering
Softwaremodernisering en architectuurherbouw vormen de kern van Eli5. We halen de complexiteit weg en leveren directe businesswaarde met pragmatische, cloud-native trajecten.
Voordat u besluit of u uw legacysysteem inpakt, een SaaS-product koopt of met AI eigen tools bouwt, hebt u volledig zicht nodig op uw huidige techlandschap.
Wilt u een vrije brainstorm over uw legacystack? Dat is de eerste stap om technische schuld om te zetten in een schaalbare, modulaire toekomst.


