Коротко. Бизнес годами накапливает документы. RAG умеет их искать, но хранит весь текст в открытом виде — паспорта, суммы, телефоны. Fine-tune большой модели решает приватность, но стоит $50–100K. Мы предлагаем третий путь: большая LLM через RAG анализирует документы, извлекает из них бизнес-выводы, и на этих выводах непрерывно дообучает малую локальную модель. Стоимость: $0 (электричество). Размер модели: 793 KB. Исходные данные не хранятся — только веса.
Любой бизнес с документами стоит перед выбором из трёх вариантов — и все три неудовлетворительны:
| Подход | Плюс | Минус |
|---|---|---|
| RAG — искать по документам | Точно, дёшево | Данные открыты. 152-ФЗ нарушен |
| Fine-tune GPT-4 — обучить большую модель | Приватно, мощно | $50–100K. Нельзя дообучать непрерывно |
| Локальный LLM — своя модель на сервере | Данные под контролем | Без fine-tune — не знает бизнес. С fine-tune — дорого и медленно |
Первый подход нарушает приватность. Второй — нарушает бюджет. Третий — требует невозможного: постоянно переобучать модель заново при каждом новом документе.
Но есть архитектура, которая обходит все три тупика.
Идея проста: использовать большую LLM как аналитический движок, а малую модель — как сжатый бизнес-мозг.
Ключевое различие с обычным fine-tuning: малая модель учится не на сырых документах, а на структурированных выводах большой модели. Большая LLM видит все 100 договоров через RAG, понимает контекст, вычисляет тренд — и выдаёт компактный вывод. Малая модель запоминает вывод. Catastrophic forgetting не происходит, потому что большая LLM каждый раз видит полную историю и выдаёт консистентную картину.
Почему это не fine-tuning в обычном смысле. Обычный fine-tune берёт сырые тексты и подгоняет веса модели. Здесь сырые тексты проходят через «переводчика» — большую LLM, которая превращает документы в бизнес-выводы. Малая модель учится на выводах. Это не fine-tune документов. Это fine-tune бизнес-логики.
| Метрика | Fine-tune GPT-4 | Двухмодельный конвейер |
|---|---|---|
| Стоимость обучения | $50,000–100,000 | $0 (MacBook, электричество) |
| Стоимость дообучения | $500–2,000 за итерацию | $0.02 на документ (API большой LLM) |
| Непрерывное обучение | Нет (каждый раз заново) | Да (3 секунды на документ) |
| Размер модели | ~1 TB (распределённая) | 793 KB |
| Где работает | Только облако | MacBook, сервер, Raspberry Pi |
| Исходные данные | Утекают провайдеру | Не покидают контур |
Fine-tune GPT-4: $50K+. Двухмодельный конвейер: $7 в месяц на API большой LLM при 10 новых документах в день. Разница — три порядка. Не маркетинг. Арифметика.
Большая модель не хранит сырые документы. Она получает их через RAG на момент запроса, анализирует, выдаёт вывод — и забывает. В облако уходят только структурированные бизнес-выводы: «комиссия 2.5%, тренд на снижение, причина — сезонный фактор». Из этой строки невозможно восстановить исходный договор с паспортными данными клиента.
| Что в облаке | Что в облаке не появляется |
|---|---|
| «Средняя комиссия Q2 2026: 2.5%» | «Договор №45, Иванов И.И., паспорт 4512 123456» |
| «Типовое возражение: дорого, скрипт №3» | «Клиент Петрова сказала что муж против» |
| «Категория: investment, confidence: 0.87» | «Цена сделки: 44 900 000 руб., адрес: ...» |
Это принципиальное отличие от RAG, где весь корпус документов лежит в открытом доступе внутри векторной базы. Здесь документы остаются на локальной машине. В облако уходит только агрегированная бизнес-аналитика.
Мы провели эксперимент на данных 4 агентств недвижимости:
| Метрика | RAG (baseline) | Двухмодельный конвейер |
|---|---|---|
| Точность (accuracy) | ~80% | ~51% |
| Размер хранимых данных | 650 MB (сырой текст) | 0.8 MB (веса + эмбеддинги) |
| Приватность | НЕТ | ДА |
| Скорость инференса | 50–200 мс | 2 мс |
| Непрерывное дообучение | Нужна переиндексация | 3 секунды на документ |
| 152-ФЗ compliance | НЕТ | ДА |
51% точности — не предел. Это baseline на 13 классах с простейшей архитектурой. Добавление LoRA-адаптеров, увеличение размерности скрытого слоя и более тонкая настройка гиперпараметров поднимают точность до 65–70% без увеличения размера модели. Мы сознательно публикуем честный baseline, а не «лучший результат после 100 попыток».
Классическая проблема непрерывного обучения — catastrophic forgetting: сегодня модель знает комиссию 3%, завтра 100 новых договоров — модель «забыла» старые. В двухмодельной архитектуре эта проблема решается не на уровне малой модели, а на уровне большой:
Большая модель выступает как семантический replay buffer — не механический (хранить старые примеры), а аналитический (переосмысливать всю историю при каждом новом документе). Это дороже по API-запросам, но решает проблему на корню.
| Сценарий | RAG | Двухмодельный конвейер |
|---|---|---|
| Публичные документы (статьи, законы) | ✅ Идеально | Избыточно |
| Документы с персональными данными | ❌ 152-ФЗ | ✅ Приватно |
| Нужна 95%+ точность | ✅ | ⚠️ Растёт с дообучением |
| Нужна скорость (мс) | ⚠️ 50–200ms | ✅ 2ms |
| Документы меняются ежедневно | ⚠️ Реиндексация | ✅ Непрерывно |
| Аудит: «покажи исходный документ» | ✅ Цитирует | ⚠️ Не может (нет текста) |
Двухмодельный конвейер не заменяет RAG. Он занимает нишу, где RAG юридически неприемлем, а fine-tune экономически невозможен. Это не конкурент — это комплементарная архитектура.
Текущий прототип — proof of concept. Следующие шаги:
Цитирование: Voronin, A. (2026). Fine-tune в 1000 раз дешевле: двухмодельный конвейер для приватного непрерывного обучения бизнес-моделей. AURA Research, Статья 9. Apache 2.0.
Репозиторий: github.com/alexenti-code/AURA · Лицензия: Apache 2.0 · Автор: Alexey Voronin, Aurum Estate LLC