BYOK — почему в регулируемых отраслях это не обсуждается
Поставщики ИИ обычно предлагают две модели тарификации: общий пул, где вы платите фиксированную сумму, покрывающую токены, или режим BYOK, где вы предоставляете собственный API-ключ и платите своему провайдеру напрямую.
В стандартном SaaS общий пул удобен. В регулируемых средах он неприемлем.
Проблема общего пула
Когда ваш поставщик предоставляет ваш ключ OpenAI / Anthropic / Mistral всем своим клиентам через единый мастер-ключ:
- Вы теряете детализацию учёта. Становится невозможно доказать аудитору, сколько именно токенов вы израсходовали у провайдера, — вы получаете агрегированный счёт.
- Вы теряете договорную цепочку. Ваши данные проходят через аккаунт поставщика. Соглашение об обработке данных (DPA) с OpenAI больше не покрывает вас напрямую.
- Вы теряете контроль над моделью. Поставщик может незаметно переключиться с модели A на модель B из соображений стоимости. Ваши бенчмарки деградируют, а вы не знаете почему.
- Вы теряете возможность мгновенного отзыва. В случае инцидента вы не можете отозвать ключ, не запросив сначала поставщика.
Что гарантирует BYOK
С BYOK:
- Ваши промпты и ответы передаются напрямую между аккаунтом вашего провайдера и betool — а не через объединённый сторонний аккаунт.
- Ваш DPA с провайдером остаётся единственной договорной цепочкой. Никакой непрозрачной субобработки.
- Ваша тарификация прозрачна: провайдер выставляет вам счёт, вы видите каждую позицию. betool выставляет счёт только за оркестрацию.
- Ваш отзыв мгновенен: перегенерируйте ключ у провайдера, и модель станет недоступной в течение нескольких секунд.
Опция приватной модели (self-hosted)
Для организаций с самыми строгими требованиями (банки, оборона, здравоохранение) даже BYOK недостаточно: отправка ваших промптов в OpenAI или Anthropic по-прежнему представляет собой передачу данных в Соединённые Штаты.
Решение — приватная модель:
- Ollama на вашем GPU для моделей с открытым исходным кодом (Llama, Qwen, Mistral, DeepSeek).
- vLLM на кластере GPU для высокопроизводительного продакшена.
- Azure OpenAI / AWS Bedrock, когда у вас есть контракт на приватное облако.
Ваши промпты никогда не покидают ваш периметр. Задержка под вашим контролем. Соответствие требованиям — полное.
Сколько это стоит
Существует миф, что self-hosting LLM стоит целое состояние. На деле для современных моделей с открытым исходным кодом класса Llama 3 / Qwen 2:
- Сервер с двумя GPU A100 80 ГБ способен обслуживать Llama-3 70B в продакшене.
- При умеренной нагрузке (несколько тысяч exchange в день) одного GPU A6000 достаточно для обслуживания модели 32B с задержкой менее секунды.
- Ежемесячная амортизация: ~$2 000–$5 000 в зависимости от вашей стратегии закупок (аренда или покупка).
По сравнению с эквивалентными расходами на OpenAI за 12 месяцев инвестиция окупается за несколько месяцев при серьёзных объёмах — а ROI полностью меняется в вашу пользу, если у вас есть ограничения по суверенитету, из-за которых OpenAI неприемлем.
Наш выбор
betool с первого дня является BYOK-native. Вы не можете использовать платформу, не подключив собственные ключи. Это сделано намеренно:
- Общий пул создаёт долг по соответствию требованиям, который мы отказываемся брать на себя ради наших регулируемых клиентов.
- Асимметрия между «мелкими клиентами» и «крупными клиентами» в вопросах суверенитета неприемлема.
- Опыт, который мы хотим построить, — «Я вижу в точности, что я потребляю, где и с кем» — возможен только с BYOK.
Это добавляет один шаг к онбордингу (15 минут на получение ключа у вашего провайдера). Это инвестиция, которая окупается со временем.