Modellen

Gebruiker implementeert eigen filter voor persoonlijke gegevens voor cloudmodellen

9 oktober 2026 · 2 min leestijd

Ook gepubliceerd in Polski

blue and black light digital wallpaper
ryan baker / Unsplash

Een gebruiker is overgestapt van het volledig zelf hosten van grote taalmodellen naar het gebruik van cloudmodellen met een eigen filter voor persoonlijke gegevens. De gebruiker testte eerder diverse hardware, waaronder de RTX PRO 6000 met 96GB, de RTX4090 met 48GB en de H200, en kocht uiteindelijk een RTX5070ti en een V100 met 32GB. De beslissing om cloudmodellen te gebruiken werd beïnvloed door stijgende hardwareprijzen en zorgen over datalekken bij aanbieders.

Het systeem maakt gebruik van een open-source filter van Cloud.ru, gebaseerd op de Apache-2.0 licentie, dat fungeert als een proxy voor zowel verzoeken als antwoorden. Het filter heeft twee modi: detectie en afdwinging. In de afdwingingsmodus worden persoonlijke gegevens en geheimen vervangen door tijdelijke aanduidingen, terwijl de detectiemodus alleen in een logboek vastlegt wat vervangen zou moeten worden.

Op 22 september trad er een storing op waarbij het filtersysteem ongeveer vier uur lang meer dan 2.600 keer probeerde te herstarten. Dit werd veroorzaakt door een fout in de configuratie van de systeemgebruiker en de cache voor modules tijdens het bouwen met go build, waardoor het uitvoerbare bestand verdween. Omdat de Ansible-regel alleen keek naar wijzigingen in de opslagplaats en niet naar het bestand zelf, werd het systeem niet correct herbouwd. Bovendien stond het systeem per ongeluk in de detectiemodus in plaats van de afdwingingsmodus.

De gebruiker koos tegen het gebruik van LiteLLM met Presidio omdat tests uitwezen dat een tussenliggende proxy de prompt-cache van de aanbieder met ongeveer 90 procent kon verminderen. Dit was problematisch gezien de 1,5 miljard gecachte tokens die in drie weken waren opgebouwd.

Om de stabiliteit te bewaken, zijn er nu twee monitors in OneUptime geïmplementeerd. Een hartslagmonitor controleert elke vijf minuten of het proces actief is en in de juiste modus staat. Een tweede monitor houdt statistieken bij voor fouten bij het maskeren of onbekende formaten, waarbij het systeem in een fail-open modus werkt: als een specifiek verzoek niet gemaskeerd kan worden, wordt het ongewijzigd verzonden om blokkades in de dagelijkse workflow te voorkomen.

Momenteel draait het filtersysteem in de afdwingingsmodus met zes typen gegevens. Lokale modellen, zoals Gemma4 en Qwen3.8, blijven in stand-by modus op een laptop en een LXC met een RTX5070ti voor specifieke taken, omdat lokale modellen volgens de gebruiker nog niet het niveau van de beste cloudmodellen bereiken.