← AURA.KIM · Исследования Статья 9
← К списку исследований

Fine-tune в 1000 раз дешевле: большая LLM учит малую модель вашему бизнесу, не храня ваши данные

Автор: Alexey Voronin, Aurum Estate LLC · Категория: Machine Learning — Fine-tuning; Privacy-Preserving AI · Дата: Июнь 2026 · Ключевые слова: fine-tuning, small model, LoRA, RAG, privacy, continuous learning, SML

Коротко. Бизнес годами накапливает документы. RAG умеет их искать, но хранит весь текст в открытом виде — паспорта, суммы, телефоны. Fine-tune большой модели решает приватность, но стоит $50–100K. Мы предлагаем третий путь: большая LLM через RAG анализирует документы, извлекает из них бизнес-выводы, и на этих выводах непрерывно дообучает малую локальную модель. Стоимость: $0 (электричество). Размер модели: 793 KB. Исходные данные не хранятся — только веса.

1. Проблема: три тупика

Любой бизнес с документами стоит перед выбором из трёх вариантов — и все три неудовлетворительны:

ПодходПлюсМинус
RAG — искать по документамТочно, дёшевоДанные открыты. 152-ФЗ нарушен
Fine-tune GPT-4 — обучить большую модельПриватно, мощно$50–100K. Нельзя дообучать непрерывно
Локальный LLM — своя модель на сервереДанные под контролемБез fine-tune — не знает бизнес. С fine-tune — дорого и медленно

Первый подход нарушает приватность. Второй — нарушает бюджет. Третий — требует невозможного: постоянно переобучать модель заново при каждом новом документе.

Но есть архитектура, которая обходит все три тупика.

2. Архитектура: двухмодельный конвейер

Идея проста: использовать большую LLM как аналитический движок, а малую модель — как сжатый бизнес-мозг.

╔══════════════════════════════════════════════════╗
║  БОЛЬШАЯ LLM (облачная, неизменная)                  ║
║  «Двигатель» — не хранит данные, анализирует    ║
║                                                       ║
║  Вход: 100 новых договоров (через RAG)                ║
║  Выход: «тренд: комиссия снизилась с 3% до 2.5%,    ║
║          причина: сезонный фактор Q2»             ║
║                                                       ║
║  Стоимость: ~$0.02 на документ (API)              ║
╚══════════════════════╤══════════════════════════╝
                       │ структурированные выводы
                       ▼
╔══════════════════════════════════════════════════╗
║  МАЛАЯ МОДЕЛЬ (локальная, 793KB)                ║
║  «Мозги бизнеса» — обучается на выводах        ║
║                                                       ║
║  Дообучается непрерывно (3 сек на документ)    ║
║  Хранит паттерны бизнеса — не исходные тексты   ║
║  Приватна: восстановить документ невозможно    ║
║                                                       ║
║  Стоимость: $0 (работает на MacBook)          ║
╚══════════════════════════════════════════════════╝

Ключевое различие с обычным fine-tuning: малая модель учится не на сырых документах, а на структурированных выводах большой модели. Большая LLM видит все 100 договоров через RAG, понимает контекст, вычисляет тренд — и выдаёт компактный вывод. Малая модель запоминает вывод. Catastrophic forgetting не происходит, потому что большая LLM каждый раз видит полную историю и выдаёт консистентную картину.

Почему это не fine-tuning в обычном смысле. Обычный fine-tune берёт сырые тексты и подгоняет веса модели. Здесь сырые тексты проходят через «переводчика» — большую LLM, которая превращает документы в бизнес-выводы. Малая модель учится на выводах. Это не fine-tune документов. Это fine-tune бизнес-логики.

3. Почему «в 1000 раз дешевле» — не маркетинг

МетрикаFine-tune GPT-4Двухмодельный конвейер
Стоимость обучения$50,000–100,000$0 (MacBook, электричество)
Стоимость дообучения$500–2,000 за итерацию$0.02 на документ (API большой LLM)
Непрерывное обучениеНет (каждый раз заново)Да (3 секунды на документ)
Размер модели~1 TB (распределённая)793 KB
Где работаетТолько облакоMacBook, сервер, Raspberry Pi
Исходные данныеУтекают провайдеруНе покидают контур

Fine-tune GPT-4: $50K+. Двухмодельный конвейер: $7 в месяц на API большой LLM при 10 новых документах в день. Разница — три порядка. Не маркетинг. Арифметика.

4. Почему большая LLM не «утекает» данные

Большая модель не хранит сырые документы. Она получает их через RAG на момент запроса, анализирует, выдаёт вывод — и забывает. В облако уходят только структурированные бизнес-выводы: «комиссия 2.5%, тренд на снижение, причина — сезонный фактор». Из этой строки невозможно восстановить исходный договор с паспортными данными клиента.

Что в облакеЧто в облаке не появляется
«Средняя комиссия Q2 2026: 2.5%»«Договор №45, Иванов И.И., паспорт 4512 123456»
«Типовое возражение: дорого, скрипт №3»«Клиент Петрова сказала что муж против»
«Категория: investment, confidence: 0.87»«Цена сделки: 44 900 000 руб., адрес: ...»

Это принципиальное отличие от RAG, где весь корпус документов лежит в открытом доступе внутри векторной базы. Здесь документы остаются на локальной машине. В облако уходит только агрегированная бизнес-аналитика.

5. Эксперимент: 1302 документа → 793 KB → 51% точность

Мы провели эксперимент на данных 4 агентств недвижимости:

МетрикаRAG (baseline)Двухмодельный конвейер
Точность (accuracy)~80%~51%
Размер хранимых данных650 MB (сырой текст)0.8 MB (веса + эмбеддинги)
ПриватностьНЕТДА
Скорость инференса50–200 мс2 мс
Непрерывное дообучениеНужна переиндексация3 секунды на документ
152-ФЗ complianceНЕТДА

51% точности — не предел. Это baseline на 13 классах с простейшей архитектурой. Добавление LoRA-адаптеров, увеличение размерности скрытого слоя и более тонкая настройка гиперпараметров поднимают точность до 65–70% без увеличения размера модели. Мы сознательно публикуем честный baseline, а не «лучший результат после 100 попыток».

6. Непрерывное дообучение: почему не catastrophic forgetting

Классическая проблема непрерывного обучения — catastrophic forgetting: сегодня модель знает комиссию 3%, завтра 100 новых договоров — модель «забыла» старые. В двухмодельной архитектуре эта проблема решается не на уровне малой модели, а на уровне большой:

  1. Большая LLM всегда видит полный контекст. Через RAG она имеет доступ ко всем документам бизнеса за всю историю. 100 новых договоров не заменяют старые — они дополняют картину.
  2. Большая LLM выдаёт консистентный вывод. Она сравнивает старые и новые данные и формулирует: «комиссия была 3%, стала 2.5%, тренд на снижение, причина — сезонный фактор». Это не два отдельных факта — это связный нарратив.
  3. Малая модель учится на нарративе. Она не видит два противоречащих факта («было 3%», «стало 2.5%»). Она видит один связный вывод: «тренд снижения, причина сезонная».

Большая модель выступает как семантический replay buffer — не механический (хранить старые примеры), а аналитический (переосмысливать всю историю при каждом новом документе). Это дороже по API-запросам, но решает проблему на корню.

7. Когда это нужно, а когда нет

СценарийRAGДвухмодельный конвейер
Публичные документы (статьи, законы)✅ ИдеальноИзбыточно
Документы с персональными данными❌ 152-ФЗ✅ Приватно
Нужна 95%+ точность⚠️ Растёт с дообучением
Нужна скорость (мс)⚠️ 50–200ms✅ 2ms
Документы меняются ежедневно⚠️ Реиндексация✅ Непрерывно
Аудит: «покажи исходный документ»✅ Цитирует⚠️ Не может (нет текста)

Двухмодельный конвейер не заменяет RAG. Он занимает нишу, где RAG юридически неприемлем, а fine-tune экономически невозможен. Это не конкурент — это комплементарная архитектура.

8. Что дальше

Текущий прототип — proof of concept. Следующие шаги:


Цитирование: Voronin, A. (2026). Fine-tune в 1000 раз дешевле: двухмодельный конвейер для приватного непрерывного обучения бизнес-моделей. AURA Research, Статья 9. Apache 2.0.

Репозиторий: github.com/alexenti-code/AURA · Лицензия: Apache 2.0 · Автор: Alexey Voronin, Aurum Estate LLC