Sari la conținut
← RegistruIntrarea 052
Planificat
2026

Modele de limbaj rulate local, fără ca datele să iasă din rețea

Laborator propriu / implementabil la client

OllamaLM StudioDockerPythonHome Assistant
Parametri model
20 mld.
Viteză
~30 tok/s
Date trimise extern
niciuna
Fișă

Context

Firmele care vor să folosească AI pe documente interne — contracte, fișe tehnice, jurnale de sistem — se blochează aproape întotdeauna în același loc: datele nu au voie să plece la un furnizor extern.

Problema

Presupunerea implicită e că ai nevoie de hardware de centru de date. Nu e adevărat, dar configurarea implicită a uneltelor de self-hosting duce la rezultate atât de proaste încât oamenii renunță și trag concluzia că modelele locale nu funcționează.

Ce am făcut

  1. 01Stivă completă pe un GPU de consum de 12 GB: modele de douăzeci de miliarde de parametri la aproximativ 30 de token-uri pe secundă
  2. 02Calibrarea contextului și a cache-ului — reglajul implicit trunchiază instrucțiunile și face modelul să pară incompetent
  3. 03Serviciul expus doar în rețeaua locală, fără acces public
  4. 04Integrare cu un agent care rulează pe cron: verificări de sănătate, backup nocturn cu retenție, supraveghere a legăturii de internet, analiză de evenimente video
  5. 05Rapoarte trimise automat în Discord, fără intervenție umană

Rezultat

Model utilizabil în producție pe hardware care costă cât o stație de lucru obișnuită. Aceeași arhitectură se instalează la client, în rețeaua lui, fără ca un singur token să ajungă la un furnizor extern.