← RegistruIntrarea 052
Planificat
2026
Modele de limbaj rulate local, fără ca datele să iasă din rețea
Laborator propriu / implementabil la client
OllamaLM StudioDockerPythonHome Assistant
- Parametri model
- 20 mld.
- Viteză
- ~30 tok/s
- Date trimise extern
- niciuna
Fișă
Context
Firmele care vor să folosească AI pe documente interne — contracte, fișe tehnice, jurnale de sistem — se blochează aproape întotdeauna în același loc: datele nu au voie să plece la un furnizor extern.
Problema
Presupunerea implicită e că ai nevoie de hardware de centru de date. Nu e adevărat, dar configurarea implicită a uneltelor de self-hosting duce la rezultate atât de proaste încât oamenii renunță și trag concluzia că modelele locale nu funcționează.
Ce am făcut
- 01Stivă completă pe un GPU de consum de 12 GB: modele de douăzeci de miliarde de parametri la aproximativ 30 de token-uri pe secundă
- 02Calibrarea contextului și a cache-ului — reglajul implicit trunchiază instrucțiunile și face modelul să pară incompetent
- 03Serviciul expus doar în rețeaua locală, fără acces public
- 04Integrare cu un agent care rulează pe cron: verificări de sănătate, backup nocturn cu retenție, supraveghere a legăturii de internet, analiză de evenimente video
- 05Rapoarte trimise automat în Discord, fără intervenție umană
Rezultat
Model utilizabil în producție pe hardware care costă cât o stație de lucru obișnuită. Aceeași arhitectură se instalează la client, în rețeaua lui, fără ca un singur token să ajungă la un furnizor extern.