Private AI & lokale LLM’s
AI binnen je eigen muren.
Open taalmodellen op je eigen hardware of private cloud. Je data verlaat nooit je organisatie.
Het probleem.
Banken, accountants en juridische praktijken willen AI, maar mogen hun data niet naar een externe AI-aanbieder sturen. En “download een model” is geen oplossing: of een model echt draait, hangt af van geheugen, context en het aantal gelijktijdige gebruikers.
Zo werkt het.
- Use case en data: wat moet het model lezen, voor wie, en onder welke regels?
- Model kiezen: open-weight modellen zoals Qwen, Llama, Mistral en Gemma, op maat van taak en budget.
- De geheugenrekensom: weights, KV-cache, activaties en overhead, zodat het past op de hardware die je kiest.
- Bouwen en tunen: vLLM, FP8-weights en -KV-cache, prefix caching en speculative decoding voor snelheid.
- Live in jouw omgeving, met een audit-trail per stap en overdracht van eigenaarschap.
Wat je krijgt.
- Advies over model en hardware: GPU-server, Mac Studio of private cloud
- Een private AI-installatie op je eigen infrastructuur
- Koppeling met je documenten (RAG) en systemen
- Optioneel: GPU’s van meerdere locaties gebundeld tot één privé-pool
- Een audit-trail per stap, voor banking, accountancy en compliance
Het bewijs.
Reken het hieronder zelf door. Dit is dezelfde geheugenberekening die we vóór elke installatie maken: per model, precisie, context en aantal gebruikers. Alles draait in je browser, er wordt niets verstuurd.
Subtotaal: 31.6 GB · +15% veiligheidsmarge
Past op (GPU)
1× L40S / RTX 6000 Ada · 48 GBPast op (Mac, unified memory)
Mac · 64 GB (46 GB bruikbaar)De KV-cache is hier 8.6 GB. Dat deel groeit met elk groter contextvenster en elke extra gelijktijdige gebruiker.
Mac unified memory: standaard is ~72% bruikbaar voor het model.
Zullen we praten?
Vertel kort wat je wilt bereiken. Je krijgt binnen een uur antwoord.