← Всички публикации

Локални LLM 7 мин четене

Локални модели, когато данните не бива да напускат офиса

Каква машина ти трябва, какво губиш спрямо облачните модели и кога компромисът си заслужава.

Има случаи, в които въпросът „може ли това да работи локално“ не е каприз: медицински данни, лични данни на клиенти, договори с клауза за конфиденциалност, изисквания на регулатор. В такива проекти локалният модел не е компромис — той е условието задачата изобщо да съществува.

Какво реално губиш

Ще бъда честен: най-добрите облачни модели са по-силни от това, което ще пуснеш на една машина в офиса. Разликата се вижда най-ясно при:

  • дълги вериги от разсъждения върху много документи наведнъж;
  • сложен код;
  • редки езикови нюанси.

Разликата е много по-малка, отколкото хората очакват, при:

  • изваждане на данни от документ по зададена схема;
  • класификация и разпределяне;
  • обобщаване на текст;
  • отговори върху предварително намерен контекст (тоест типичния RAG).

С други думи — точно в задачите, за които фирмите най-често искат AI, локалният модел е напълно достатъчен.

Каква машина

Груби ориентири за екип до 20 души, които ползват системата през работния ден:

  • Един GPU с 24 GB памет — стига за модел от среден клас с квантизация и няколко едновременни заявки. Това е най-честият избор.
  • 48 GB — по-голям модел или повече едновременни потребители, без да се редят на опашка.
  • Без GPU, само процесор — става за нощни задачи на партиди (обработи 500 документа до сутринта). За интерактивен чат е бавно и хората спират да го ползват.

Не забравяй втория разход: някой трябва да поддържа тази машина. Ако във фирмата няма кой, по-разумно е да стои при доставчик в ЕС, отколкото под бюрото на счетоводителя.

Хибридът, който препоръчвам най-често

Пълната изолация рядко е нужна за всичко. Работещият вариант:

  1. Чувствителните документи се обработват локално — индексиране, търсене, изваждане на данни.
  2. Ако конкретна заявка не съдържа лични данни, тя може да отиде към облачен модел за по-добър отговор.
  3. Има ясно правило кое къде отива, записано в настройките, а не в главата на разработчика — и лог, който го доказва.

Така плащаш за силния модел само там, където той наистина има значение.

Как да провериш за две седмици

Преди да купиш каквото и да е:

  1. Вземи 50 реални задачи от твоя процес.
  2. Пусни ги през облачен модел и запиши резултатите — това е горната граница.
  3. Пусни ги през локален модел под наем (GPU на час).
  4. Сравни. Ако разликата е в рамките на поносимото, инвестицията в собствен хардуер има смисъл.

Тази проверка струва стотици левове и спестява десетки хиляди в грешна посока.

Кога да не го правиш

Ако единствената причина да искаш локален модел е „не искаме да плащаме на месец“ — сметката рядко излиза. Хардуерът, токът и поддръжката за три години обикновено надхвърлят абонамента, особено при малък брой заявки.

Локално се прави, когато данните го изискват. Не за да спестиш.