Локални модели, когато данните не бива да напускат офиса
Каква машина ти трябва, какво губиш спрямо облачните модели и кога компромисът си заслужава.
Има случаи, в които въпросът „може ли това да работи локално“ не е каприз: медицински данни, лични данни на клиенти, договори с клауза за конфиденциалност, изисквания на регулатор. В такива проекти локалният модел не е компромис — той е условието задачата изобщо да съществува.
Какво реално губиш
Ще бъда честен: най-добрите облачни модели са по-силни от това, което ще пуснеш на една машина в офиса. Разликата се вижда най-ясно при:
- дълги вериги от разсъждения върху много документи наведнъж;
- сложен код;
- редки езикови нюанси.
Разликата е много по-малка, отколкото хората очакват, при:
- изваждане на данни от документ по зададена схема;
- класификация и разпределяне;
- обобщаване на текст;
- отговори върху предварително намерен контекст (тоест типичния RAG).
С други думи — точно в задачите, за които фирмите най-често искат AI, локалният модел е напълно достатъчен.
Каква машина
Груби ориентири за екип до 20 души, които ползват системата през работния ден:
- Един GPU с 24 GB памет — стига за модел от среден клас с квантизация и няколко едновременни заявки. Това е най-честият избор.
- 48 GB — по-голям модел или повече едновременни потребители, без да се редят на опашка.
- Без GPU, само процесор — става за нощни задачи на партиди (обработи 500 документа до сутринта). За интерактивен чат е бавно и хората спират да го ползват.
Не забравяй втория разход: някой трябва да поддържа тази машина. Ако във фирмата няма кой, по-разумно е да стои при доставчик в ЕС, отколкото под бюрото на счетоводителя.
Хибридът, който препоръчвам най-често
Пълната изолация рядко е нужна за всичко. Работещият вариант:
- Чувствителните документи се обработват локално — индексиране, търсене, изваждане на данни.
- Ако конкретна заявка не съдържа лични данни, тя може да отиде към облачен модел за по-добър отговор.
- Има ясно правило кое къде отива, записано в настройките, а не в главата на разработчика — и лог, който го доказва.
Така плащаш за силния модел само там, където той наистина има значение.
Как да провериш за две седмици
Преди да купиш каквото и да е:
- Вземи 50 реални задачи от твоя процес.
- Пусни ги през облачен модел и запиши резултатите — това е горната граница.
- Пусни ги през локален модел под наем (GPU на час).
- Сравни. Ако разликата е в рамките на поносимото, инвестицията в собствен хардуер има смисъл.
Тази проверка струва стотици левове и спестява десетки хиляди в грешна посока.
Кога да не го правиш
Ако единствената причина да искаш локален модел е „не искаме да плащаме на месец“ — сметката рядко излиза. Хардуерът, токът и поддръжката за три години обикновено надхвърлят абонамента, особено при малък брой заявки.
Локално се прави, когато данните го изискват. Не за да спестиш.