Что реально умеет локальная модель: тестируем ИИ-помощника на задачах бизнеса
Поставили две открытые модели на офисный компьютер с игровой видеокартой и прогнали 75 деловых задач на русском. Где помощник справляется на 100%, где выдумывает — и почему одна строка в настройках решает больше, чем замена видеокарты.

Представьте: вы владелец стоматологической клиники или автосервиса. Администраторы не успевают отвечать на однотипные вопросы в WhatsApp: «Сколько стоит чистка?», «А к Иванову на завтра есть запись?». Хочется поставить ИИ-помощника, который возьмёт на себя рутину. Но тут же возникает вопрос: а как быть с базой клиентов? Отдавать переписку с пациентами в чужое облако — идея так себе.
Возникает логичная мысль: а что, если поставить такого помощника у себя, на обычном офисном компьютере прямо в кабинете, чтобы данные никуда не уходили? Потянет ли машина такую задачу? Поймёт ли помощник русский язык с опечатками? И главное — не начнёт ли он врать клиентам, обещая скидки, которых нет?
Мы решили не гадать, а проверить.
Что мы сделали
Мы взяли обычный мощный компьютер с игровой видеокартой (NVIDIA RTX 3090, 24 гигабайта видеопамяти) и 64 гигабайтами оперативной памяти. На него поставили две языковые модели с открытыми весами — Qwen и Muse Glimmer.
Дальше прогнали через них 75 типичных деловых задач на русском языке. Пять типов задач, по 15 примеров на каждую:
- Превратить заявку в структуру. Например: «Здравствуйте, хотел бы записаться на чистку зубов, меня зовут Игорь, телефон 89211234567, желательно во вторник после обеда» нужно было аккуратно разложить по полям.
- Ответить по документу. Мы давали прайс или регламент и задавали вопрос, ответ на который там точно был.
- Отказать, когда ответа нет. Самая важная проверка. Спрашивали цену брекетов или адрес клиники, которых в тексте не было.
- Понять суть обращения (классификация). Заявка, жалоба, вопрос о цене, общий вопрос или спам.
- Вызвать нужный инструмент. Понять, что сейчас нужно: записать человека, отменить визит, узнать цену или проверить свободные окна.
Проверял не человек «на глазок» и не сама нейросеть. Проверял безжалостный код, сверяя каждый ответ с заранее записанным эталоном. Пороги успешности мы зафиксировали до первого запуска, чтобы не было соблазна подогнать результаты.
Все опубликованные тесты этих моделей — англоязычные. А нам было важно узнать, как помощник справится с русским языком в реальных условиях.
Что получилось хорошо
Если коротко — локальный помощник справляется.
Основным подопытным стала сжатая версия модели Qwen (файл на 17 гигабайт). Вот её результаты после правильной настройки:
| Задача | Результат |
|---|---|
| Разобрать заявку на поля | 100% читаемый результат, 98,3% точности |
| Ответить по прайсу | 100% |
| Честно отказать, если данных нет | 100% |
| Классифицировать обращение | 100% |
| Вызвать нужный инструмент | 100% |
Медиана времени ответа на короткие задачи — от 2,6 до 5,5 секунды. Ни одного сбоя связи.
Обязательная оговорка: мы прогоняли по 15 примеров на каждую задачу. При таком объёме выборки нельзя кричать, что модель «гарантирует сто процентов точности всегда и везде». Но это показывает главное: на реальных деловых задачах программа полностью работоспособна.
Скажет ли она клиенту неправду
Самый большой страх бизнеса — ИИ начнет выдумывать цены или несуществующие услуги. Мы задали 15 вопросов, ответов на которые в переданном документе просто не было. Спрашивали цену установки брекетов, количество врачей, наличие рассрочки.
Результат: 100% корректных отказов. Ноль выдуманных цен и чисел. Помощник честно отвечал: «В документе указан только город — Великий Новгород, конкретного адреса и маршрута проезда в нём нет».
Казалось бы, полная победа? Как бы не так.
Берем ту же самую модель. Даем задачу на проверку свободных окон и спрашиваем: «Свободно ли что-нибудь завтра?». Ответ системы: проверить расписание на 16 июня 2026 года.
Дата была абсолютно выдумана. Мы не передавали помощнику сегодняшнее число, и вместо того, чтобы сказать «я не знаю», он просто подставил правдоподобную дату.
Как одна строка меняет всё
Разница между честным отказом и выдуманной датой была не в модели. Разница была в постановке задачи.
В первой задаче мы прямо написали в инструкции: «если ответа нет — так и скажи». Во второй задаче такой инструкции не было. Дисциплина «я не знаю» не встроена в помощника изначально — она задается вашими правилами.
Мы немного изменили системную инструкцию. Передали текущую дату и дописали одно правило: «данных нет — оставь поле пустым, не придумывай».
Результат — сто процентов правильных ответов. Помощник перестал выдумывать дату и начал безошибочно понимать, что «в пятницу» — это 28 августа 2026 года, а «3 марта» — это 3 марта. Ни замены видеокарты, ни дообучения программы. Одна правильная строчка в настройках решила проблему.
Оценка самой программы и её пригодность для работы — разные вещи. Между «отличной моделью» и «работающим помощником» стоит настройка.
Границы: сколько текста он помнит
У каждого помощника есть память диалога — то, сколько текста он может держать перед глазами одновременно. И здесь есть жесткие физические рамки.
Файл нашей модели весит 17 гигабайт. Видеокарта вмещает чуть больше 24 гигабайт. Кажется, что остается еще 7 гигабайт свободного места. На деле, память съедает само хранилище диалога. На средних объемах текста занято уже больше восьмидесяти процентов карты, а при длинном диалоге свободно остается жалких 628 мегабайт.
Мы замерили, как быстро помощник отвечает, если загрузить в него документы разной длины:
| Объем документа в памяти | Время ответа |
|---|---|
| ~15–20 страниц текста (около 30 тысяч знаков) | 9,6 с |
| Увеличение в 2 раза | 18,7 с |
| Увеличение в 4 раза | 38,5 с |
| Увеличение в 8 раз (около 120 страниц) | 116,7 с |
Здесь важно, кто ждёт ответа.
Если это живой диалог с клиентом в чате — предел десять секунд. Никто не будет висеть две минуты, ожидая реплику. Значит, на таком компьютере помощник уверенно держит 15–20 страниц: прайс-лист, регламент, инструкции для сотрудников помещаются с большим запасом и работают за секунды.
Если же это фоновая задача — собрать отчёт, разобрать за ночь накопившиеся обращения, проанализировать выгрузку — те же две минуты совершенно нормальны. Никто не сидит над экраном, и в один проход можно загрузить все сто с лишним страниц.
Одно и то же железо, один и тот же замер — а выводы разные. Ошибка, которую легко допустить: перенести требования чата на все задачи подряд и решить, что «не тянет».
И тут есть важный нюанс: размер памяти диалога нужно настраивать под реальную длину ваших документов, а не выкручивать резерв «на всякий случай». Конфигурация, где зарезервировано гигантское количество места, отвечает на короткий вопрос вдвое медленнее. Запас карман тянет.
Кстати, у модели есть параметр сжатия памяти диалога. Опасения, что это испортит качество, не подтвердились. Качество не падает, а свободного места на видеокарте становится больше — при длинном диалоге экономится почти два гигабайта.
Две модели с разными характерами
Мы тестировали две разные программы. Первая (Qwen) весит 17 гигабайт. Вторая (Muse Glimmer) полегче — файл на 14,79 гигабайта. В задачах на извлечение заявки, ответы по прайсу и отказы обе справились одинаково.
Но вели они себя по-разному, когда данных не хватало. На вопрос «Свободно ли завтра?» Glimmer останавливалась и спрашивала: «Завтра — это какое число для вас? Укажите дату, и я проверю свободные окна». Qwen в том же случае подставляла дату сама. Причём в одном прогоне подставляла, а в другом — переспрашивала: поведение на границе плавает даже при полностью фиксированных настройках.
Мы приняли за правильное поведение именно переспрашивать. Ошибочная запись пациента на случайный день обойдется бизнесу куда дороже, чем один лишний вопрос в чате. Разный характер программ означает, что выбирать их нужно под задачу. К тому же, оставлять правило «данных не хватает — спроси» на усмотрение самой программы нельзя. Его всегда нужно прописывать явно.
Наш замер показал еще одну интересную вещь, и она нас самих сбила с толку. У моделей есть параметр — насколько глубоко они обдумывают ответ. По умолчанию он выкручен на максимум, и на отдельных примерах это выглядит вопиюще расточительно: на вопрос «а где вы находитесь?» модель потратила 429 единиц работы вместо 59, чтобы выдать ровно тот же ответ.
Мы решили, что нашли способ сэкономить. А на полном наборе из 75 задач экономии не оказалось вовсе — разброс около 8%. Выяснилось, что режим по умолчанию распределяет усилия умно: много думает над сложным, мало над простым. Понижение глубины экономит на разборе заявок, но вдвое перерасходует на простых односложных ответах.
Зато снижение глубины не ухудшило качество ни на одной задаче, а на двух даже улучшило его. Вывод не в экономии, а в другом: настройки по умолчанию — это не то, что нужно вам, и проверять их приходится замером, а не интуицией.
Что настройка даёт даром
На десерт — про скорость. Существует технология, когда рядом с основной программой-помощником запускают маленькую модель-подсказчик. Маленькая угадывает продолжение текста, а основная её только проверяет.
Подсказчик есть для обеих моделей, которые мы проверяли, и выигрыш у них разный. Glimmer прошёл 75 задач за 160 секунд вместо 379 — ускорение в 2,4 раза. Qwen ускорился скромнее, с 271 секунды до 170, то есть в 1,6 раза.
Качество в обоих случаях не изменилось ни на одну десятую — все показатели успешности совпали в точности. Плата — место на видеокарте под самого подсказчика: 2,5 гигабайта у Glimmer, 1,3 у Qwen. По сути, почти бесплатный прирост скорости без потери смыслов.
По абсолютному времени связки сравнялись — 170 секунд против 160. Но Qwen при этом отвечает точнее и заметно короче. Если выбирать одну конфигурацию для деловых задач — мы бы взяли эту.
Правда, дословного повторения ответов при этом нет. То есть сегодня помощник скажет: «Отмена записи должна быть не позднее чем за 4 часа», а завтра — «Отмена записи должна быть не позднее чем за 4 часа до приёма». Оба ответа верные. Практический вывод: на устойчивость качества полагаться можно смело, а вот на то, что робот будет отвечать одинаково буква в букву — нет.
Что это значит для бизнеса
Локальный ИИ-помощник — это не абстрактная революция из новостей, а конкретный рабочий инструмент. Он реально может взять на себя рутину: классифицировать заявки, отвечать по регламенту и прайсу, проверять расписание. Всё это происходит на вашем офисном компьютере, и данные клиентов никуда не уходят.
Но сам по себе скачанный файл — это ещё не сотрудник. Без грамотной настройки он начнет додумывать за клиента то, чего не знает, и тратить компьютерные ресурсы впустую. Его нужно настраивать, ограничивать контекст под реальные задачи и задавать жесткие правила.
Вопрос в том, сколько всё это стоит: сам компьютер, настройка и поддержка. Мы это посчитали отдельно — во что обходится своя машина, аренда и готовый API. Забегая вперёд: дешевле всего как раз не покупать машину.