2САЙТ

Что реально умеет локальная модель: тестируем ИИ-помощника на задачах бизнеса

Поставили две открытые модели на офисный компьютер с игровой видеокартой и прогнали 75 деловых задач на русском. Где помощник справляется на 100%, где выдумывает — и почему одна строка в настройках решает больше, чем замена видеокарты.

Что реально умеет локальная модель: тестируем ИИ-помощника на задачах бизнеса
23.08.2026
локальные моделиИИ для бизнесаИИ-агенты

Представьте: вы владелец стоматологической клиники или автосервиса. Администраторы не успевают отвечать на однотипные вопросы в WhatsApp: «Сколько стоит чистка?», «А к Иванову на завтра есть запись?». Хочется поставить ИИ-помощника, который возьмёт на себя рутину. Но тут же возникает вопрос: а как быть с базой клиентов? Отдавать переписку с пациентами в чужое облако — идея так себе.

Возникает логичная мысль: а что, если поставить такого помощника у себя, на обычном офисном компьютере прямо в кабинете, чтобы данные никуда не уходили? Потянет ли машина такую задачу? Поймёт ли помощник русский язык с опечатками? И главное — не начнёт ли он врать клиентам, обещая скидки, которых нет?

Мы решили не гадать, а проверить.

Что мы сделали

Мы взяли обычный мощный компьютер с игровой видеокартой (NVIDIA RTX 3090, 24 гигабайта видеопамяти) и 64 гигабайтами оперативной памяти. На него поставили две языковые модели с открытыми весами — Qwen и Muse Glimmer.

Дальше прогнали через них 75 типичных деловых задач на русском языке. Пять типов задач, по 15 примеров на каждую:

  1. Превратить заявку в структуру. Например: «Здравствуйте, хотел бы записаться на чистку зубов, меня зовут Игорь, телефон 89211234567, желательно во вторник после обеда» нужно было аккуратно разложить по полям.
  2. Ответить по документу. Мы давали прайс или регламент и задавали вопрос, ответ на который там точно был.
  3. Отказать, когда ответа нет. Самая важная проверка. Спрашивали цену брекетов или адрес клиники, которых в тексте не было.
  4. Понять суть обращения (классификация). Заявка, жалоба, вопрос о цене, общий вопрос или спам.
  5. Вызвать нужный инструмент. Понять, что сейчас нужно: записать человека, отменить визит, узнать цену или проверить свободные окна.

Проверял не человек «на глазок» и не сама нейросеть. Проверял безжалостный код, сверяя каждый ответ с заранее записанным эталоном. Пороги успешности мы зафиксировали до первого запуска, чтобы не было соблазна подогнать результаты.

Все опубликованные тесты этих моделей — англоязычные. А нам было важно узнать, как помощник справится с русским языком в реальных условиях.

Что получилось хорошо

Если коротко — локальный помощник справляется.

Основным подопытным стала сжатая версия модели Qwen (файл на 17 гигабайт). Вот её результаты после правильной настройки:

ЗадачаРезультат
Разобрать заявку на поля100% читаемый результат, 98,3% точности
Ответить по прайсу100%
Честно отказать, если данных нет100%
Классифицировать обращение100%
Вызвать нужный инструмент100%

Медиана времени ответа на короткие задачи — от 2,6 до 5,5 секунды. Ни одного сбоя связи.

Обязательная оговорка: мы прогоняли по 15 примеров на каждую задачу. При таком объёме выборки нельзя кричать, что модель «гарантирует сто процентов точности всегда и везде». Но это показывает главное: на реальных деловых задачах программа полностью работоспособна.

Скажет ли она клиенту неправду

Самый большой страх бизнеса — ИИ начнет выдумывать цены или несуществующие услуги. Мы задали 15 вопросов, ответов на которые в переданном документе просто не было. Спрашивали цену установки брекетов, количество врачей, наличие рассрочки.

Результат: 100% корректных отказов. Ноль выдуманных цен и чисел. Помощник честно отвечал: «В документе указан только город — Великий Новгород, конкретного адреса и маршрута проезда в нём нет».

Казалось бы, полная победа? Как бы не так.

Берем ту же самую модель. Даем задачу на проверку свободных окон и спрашиваем: «Свободно ли что-нибудь завтра?». Ответ системы: проверить расписание на 16 июня 2026 года.

Дата была абсолютно выдумана. Мы не передавали помощнику сегодняшнее число, и вместо того, чтобы сказать «я не знаю», он просто подставил правдоподобную дату.

Как одна строка меняет всё

Разница между честным отказом и выдуманной датой была не в модели. Разница была в постановке задачи.

В первой задаче мы прямо написали в инструкции: «если ответа нет — так и скажи». Во второй задаче такой инструкции не было. Дисциплина «я не знаю» не встроена в помощника изначально — она задается вашими правилами.

Мы немного изменили системную инструкцию. Передали текущую дату и дописали одно правило: «данных нет — оставь поле пустым, не придумывай».

Результат — сто процентов правильных ответов. Помощник перестал выдумывать дату и начал безошибочно понимать, что «в пятницу» — это 28 августа 2026 года, а «3 марта» — это 3 марта. Ни замены видеокарты, ни дообучения программы. Одна правильная строчка в настройках решила проблему.

Оценка самой программы и её пригодность для работы — разные вещи. Между «отличной моделью» и «работающим помощником» стоит настройка.

Границы: сколько текста он помнит

У каждого помощника есть память диалога — то, сколько текста он может держать перед глазами одновременно. И здесь есть жесткие физические рамки.

Файл нашей модели весит 17 гигабайт. Видеокарта вмещает чуть больше 24 гигабайт. Кажется, что остается еще 7 гигабайт свободного места. На деле, память съедает само хранилище диалога. На средних объемах текста занято уже больше восьмидесяти процентов карты, а при длинном диалоге свободно остается жалких 628 мегабайт.

Мы замерили, как быстро помощник отвечает, если загрузить в него документы разной длины:

Объем документа в памятиВремя ответа
~15–20 страниц текста (около 30 тысяч знаков)9,6 с
Увеличение в 2 раза18,7 с
Увеличение в 4 раза38,5 с
Увеличение в 8 раз (около 120 страниц)116,7 с

Здесь важно, кто ждёт ответа.

Если это живой диалог с клиентом в чате — предел десять секунд. Никто не будет висеть две минуты, ожидая реплику. Значит, на таком компьютере помощник уверенно держит 15–20 страниц: прайс-лист, регламент, инструкции для сотрудников помещаются с большим запасом и работают за секунды.

Если же это фоновая задача — собрать отчёт, разобрать за ночь накопившиеся обращения, проанализировать выгрузку — те же две минуты совершенно нормальны. Никто не сидит над экраном, и в один проход можно загрузить все сто с лишним страниц.

Одно и то же железо, один и тот же замер — а выводы разные. Ошибка, которую легко допустить: перенести требования чата на все задачи подряд и решить, что «не тянет».

И тут есть важный нюанс: размер памяти диалога нужно настраивать под реальную длину ваших документов, а не выкручивать резерв «на всякий случай». Конфигурация, где зарезервировано гигантское количество места, отвечает на короткий вопрос вдвое медленнее. Запас карман тянет.

Кстати, у модели есть параметр сжатия памяти диалога. Опасения, что это испортит качество, не подтвердились. Качество не падает, а свободного места на видеокарте становится больше — при длинном диалоге экономится почти два гигабайта.

Две модели с разными характерами

Мы тестировали две разные программы. Первая (Qwen) весит 17 гигабайт. Вторая (Muse Glimmer) полегче — файл на 14,79 гигабайта. В задачах на извлечение заявки, ответы по прайсу и отказы обе справились одинаково.

Но вели они себя по-разному, когда данных не хватало. На вопрос «Свободно ли завтра?» Glimmer останавливалась и спрашивала: «Завтра — это какое число для вас? Укажите дату, и я проверю свободные окна». Qwen в том же случае подставляла дату сама. Причём в одном прогоне подставляла, а в другом — переспрашивала: поведение на границе плавает даже при полностью фиксированных настройках.

Мы приняли за правильное поведение именно переспрашивать. Ошибочная запись пациента на случайный день обойдется бизнесу куда дороже, чем один лишний вопрос в чате. Разный характер программ означает, что выбирать их нужно под задачу. К тому же, оставлять правило «данных не хватает — спроси» на усмотрение самой программы нельзя. Его всегда нужно прописывать явно.

Наш замер показал еще одну интересную вещь, и она нас самих сбила с толку. У моделей есть параметр — насколько глубоко они обдумывают ответ. По умолчанию он выкручен на максимум, и на отдельных примерах это выглядит вопиюще расточительно: на вопрос «а где вы находитесь?» модель потратила 429 единиц работы вместо 59, чтобы выдать ровно тот же ответ.

Мы решили, что нашли способ сэкономить. А на полном наборе из 75 задач экономии не оказалось вовсе — разброс около 8%. Выяснилось, что режим по умолчанию распределяет усилия умно: много думает над сложным, мало над простым. Понижение глубины экономит на разборе заявок, но вдвое перерасходует на простых односложных ответах.

Зато снижение глубины не ухудшило качество ни на одной задаче, а на двух даже улучшило его. Вывод не в экономии, а в другом: настройки по умолчанию — это не то, что нужно вам, и проверять их приходится замером, а не интуицией.

Что настройка даёт даром

На десерт — про скорость. Существует технология, когда рядом с основной программой-помощником запускают маленькую модель-подсказчик. Маленькая угадывает продолжение текста, а основная её только проверяет.

Подсказчик есть для обеих моделей, которые мы проверяли, и выигрыш у них разный. Glimmer прошёл 75 задач за 160 секунд вместо 379 — ускорение в 2,4 раза. Qwen ускорился скромнее, с 271 секунды до 170, то есть в 1,6 раза.

Качество в обоих случаях не изменилось ни на одну десятую — все показатели успешности совпали в точности. Плата — место на видеокарте под самого подсказчика: 2,5 гигабайта у Glimmer, 1,3 у Qwen. По сути, почти бесплатный прирост скорости без потери смыслов.

По абсолютному времени связки сравнялись — 170 секунд против 160. Но Qwen при этом отвечает точнее и заметно короче. Если выбирать одну конфигурацию для деловых задач — мы бы взяли эту.

Правда, дословного повторения ответов при этом нет. То есть сегодня помощник скажет: «Отмена записи должна быть не позднее чем за 4 часа», а завтра — «Отмена записи должна быть не позднее чем за 4 часа до приёма». Оба ответа верные. Практический вывод: на устойчивость качества полагаться можно смело, а вот на то, что робот будет отвечать одинаково буква в букву — нет.

Что это значит для бизнеса

Локальный ИИ-помощник — это не абстрактная революция из новостей, а конкретный рабочий инструмент. Он реально может взять на себя рутину: классифицировать заявки, отвечать по регламенту и прайсу, проверять расписание. Всё это происходит на вашем офисном компьютере, и данные клиентов никуда не уходят.

Но сам по себе скачанный файл — это ещё не сотрудник. Без грамотной настройки он начнет додумывать за клиента то, чего не знает, и тратить компьютерные ресурсы впустую. Его нужно настраивать, ограничивать контекст под реальные задачи и задавать жесткие правила.

Вопрос в том, сколько всё это стоит: сам компьютер, настройка и поддержка. Мы это посчитали отдельно — во что обходится своя машина, аренда и готовый API. Забегая вперёд: дешевле всего как раз не покупать машину.