От GPT до собственных моделей: что инвестор должен проверить перед покупкой AI-компании

От GPT до собственных моделей: что инвестор должен проверить перед покупкой AI-компании

За последний год AI-стартапы стали одной из самых привлекательных целей для инвестиций и сделок M&A. Однако многие инвесторы и основатели продолжают подходить к юридической проверке AI-компаний так же, как к покупке обычного разработчика программного обеспечения. Это ошибка. Если для классической IT-компании ключевым активом является исходный код, то для AI-бизнеса не меньшую ценность представляют обучающие данные, веса модели, лицензии на базовые модели, инфраструктура обучения и соблюдение требований AI-регулирования. Именно эти элементы сегодня становятся причиной многих конфликтов после закрытия сделки.

Инна Семенова и Егор Кулаженко, юристы REVERA Law Group, разбирают сделки с AI-активами. Так чем же оценка AI-продукта отличается от оценки классического софта?

Из чего состоит AI-продукт

В обычной IT-сделке инвестор проверяет права на код: перешли ли они компании от сотрудников и подрядчиков, зарегистрирован ли товарный знак, чисты ли open-source лицензии. Для AI-продукта этого недостаточно – внутри него есть четыре самостоятельных элемента, и каждый охраняется по-своему.

  • Архитектура модели – устройство нейросети: количество слоев, математические операции. Обычно она описана в открытых научных публикациях (transformer лежит в основе GPT и Claude), поэтому сама по себе ценности почти не представляет.
  • Веса модели – числовые параметры, полученные в результате обучения. Именно в них — вся «экономика» AI-продукта.
  • Датасеты – данные, на которых модель обучалась и проверялась. От их происхождения зависят и качество модели, и юридические риски.
  • Инфраструктура и пайплайн обучения – инструменты, благодаря которым модель можно дообучать и развивать. Без них покупатель получает «модель в моменте», но не может ее развивать после закрытия сделки.

Веса модели – актив без собственного правового режима

Веса современной языковой модели – это набор файлов с миллиардами параметров весом от сотен мегабайт до сотен гигабайт. Отдельного правового режима для их охраны нет ни в ЕС, ни в США –защита собирается из нескольких механизмов.

  • Авторское право в таком случае почти не работает: в США охрана требует творческого вклада человека, а параметры модели формируются автоматически в ходе оптимизации. В ЕС теоретически возможно отнести веса к программе или базе данных, но практики пока нет.
  • Коммерческая тайна – основной работающий режим для моделей с закрытыми весами. Он действует, пока информация не раскрыта и пока компания принимает разумные меры по защите конфиденциальности. Как только веса публикуются (как у Llama, Mistral, Falcon), этот режим исчезает – остаются только условия лицензии.
  • Контрактные ограничения – когда веса открываются клиенту (например, при развертывании на его серверах), запреты на копирование, reverse engineering, дистилляцию и передачу третьим лицам можно закрепить только договором.

Для инвестора это значит: формулировка «все права на программное обеспечение переходят покупателю» для весов модели не работает. Если веса не признают «программой», а компания не поддерживала режим коммерческой тайны — покупатель получает актив без реальной правовой защиты.

Что делать: включить в документы сделки отдельный технический перечень передаваемых компонентов – с указанием, каким режимом каждый из них защищен, где хранится и на каких условиях лицензирован.

Чужие данные

Один из самых острых вопросов в AI-сделках 2024–2026 годов. Почти любая современная модель обучалась в том числе на данных, на которые у компании не было прямой лицензии. Вопрос в том, было ли это нарушением – и переходит ли риск к покупателю вместе с моделью.

В США компании защищаются доктриной fair use (добросовестное использование). Насколько она устоит, сейчас проверяется в резонансных делах The New York Times v. OpenAI & Microsoft Bartz v. Anthropiс. Поскольку fair use — это позиция, а не факт, включать в SPA заверение «обучение было добросовестным использованием» не стоит. Но можно и нужно дать заверение о происхождении обучающих данных и об отсутствии заведомо нелегальных источников.

В Европе логика другая — там опираются не на суды, а на прямые нормы. Директива о едином цифровом рынке (DSM Directive) разрешает text and data mining: для науки – без ограничений, для бизнеса – если правообладатель не выразил отказ в машиночитаемой форме. Первое заметное решение по теме – LAION v. Kneschke (Германия, сентябрь 2024) – подтвердило, что для некоммерческого исследовательского использования это исключение работает.

Если в обучающих данных были персональные данные (а для текстовых моделей это почти всегда так), добавляется GDPR. Право на удаление данных плохо совместимо с уже обученной моделью — «отучить» ее от конкретных данных без переобучения невозможно. В декабре 2024 года итальянский регулятор Garante оштрафовал OpenAI на 15 млн евро именно за нарушения при обработке персональных данных в обучении.

Стандартный аудит персональных данных чаще всего проверяет работу с данными клиентов в продукте — и пропускает происхождение обучающих данных. Это стоит проверять отдельно.

On-premise vs SaaS: разные риски сделки

Способ распространения AI-продукта напрямую определяет структуру рисков.

SaaS – веса остаются у разработчика, клиент получает только доступ через интернет (OpenAI API, Anthropic API, большинство AI-стартапов). Здесь главный риск – компрометация внутренней среды и устойчивость клиентской базы. На due diligence стоит смотреть на сертификации (ISO 27001, SOC 2), систему управления доступом и договоры с ключевыми клиентами.

On-premise – модель разворачивается в инфраструктуре клиента, который получает фактический доступ к весам (корпоративные языковые модели, медицинские и финансовые решения). Здесь риск смещается в сторону лицензирования: ушедший клиент с копией модели потенциально становится конкурентом. Важно, есть ли в лицензии прямой запрет на дистилляцию и передачу модели третьим лицам, и применяются ли технические средства защиты вроде привязки к оборудованию.

С каждой новой on-premise-установкой режим коммерческой тайны для весов слабеет. Если лицензии у клиентов составлены слабо, а технической защиты нет — заявление компании об охране весов как коммерческой тайны становится недостоверным.

Отдельный случай  продукты поверх чужих API (OpenAI, Anthropic, Google). Технически это набор промптов, подключенная база знаний клиента и интерфейс. Юридически главный актив — не веса (они принадлежат провайдеру), а контракт с провайдером и накопленные методики работы с моделью. Стоит проверить условия использования базовой модели — например, корпоративные условия OpenAI прямо запрещают использовать результаты работы моделей для обучения конкурентов — и оценить зависимость от конкретного поставщика.

Лицензии на модели с открытыми весами тоже стоит читать внимательно — за вывеской open source нередко скрываются коммерческие ограничения.

Нарушение условий лицензии базовой модели может стоить компании самого актива: правообладатель вправе ее отозвать.

Что реально работает для защиты AI-продукта

  • Авторское право работает только для классического кода — обучающей и эксплуатационной инфраструктуры, MLOps-инструментов. Архитектуру модели, если она опубликована в научной статье, оно не защищает.
  • Веса — спорная зона: в США охрана авторским правом практически невозможна, в ЕС теоретически возможна, но без подтвержденной практики.
  • Датасеты охраняются на двух уровнях: отдельные элементы — если это чужие охраняемые произведения (компания не получает на них прав, даже если они попали в ее обучающий массив), сам датасет как собрание — если в его создание вложены значительные инвестиции.
  • Результаты работы модели в США авторским правом не охраняются вовсе, в ЕС подходы разнятся по странам, но движутся в ту же сторону.

Поэтому основным работающим режимом для AI остается коммерческая тайна – она не требует регистрации, не имеет срока действия и охватывает разнородные элементы: от весов до параметров обучения. Но она держится на одном условии – «разумных мерах по обеспечению конфиденциальности». На практике это значит, что в компании должны быть:

  • система разграничения доступа с журналированием действий;
  • обязанности по конфиденциальности в трудовых договорах;
  • NDA со всеми контрагентами, имевшими доступ к ключевым компонентам;
  • маркировка систем хранения как конфиденциальных;
  • порядок отзыва доступов при увольнении и реакции на инциденты;
  • политика участия сотрудников в сторонних open-source проектах.

Если этих элементов нет, заявление компании об охране моделей коммерческой тайной ничем не подтверждено — и покупатель получает актив без реальной правовой защиты.

Почему это актуально для Казахстана

Казахстан активно развивает AI-экосистему: появляются новые AI-стартапы, корпоративные решения на базе генеративного AI, государственные инициативы по цифровизации и интерес международных инвесторов к технологическим компаниям региона. При этом большинство таких проектов используют зарубежные модели (OpenAI, Anthropic, Google, Mistral, Llama), а значит автоматически сталкиваются с вопросами лицензирования, защиты данных и интеллектуальной собственности. Поэтому юридическая подготовка AI-компании к привлечению инвестиций становится конкурентным преимуществом уже на ранней стадии.

Вместо резюме

Универсального режима охраны AI-продукта не существует. Работающая защита — это всегда многоуровневая конструкция: архитектура и методы — коммерческая тайна и ноу-хау; исходный код — авторское право и open-source лицензии; веса — коммерческая тайна плюс контракты, а при on-premise — еще и техническая защита; датасеты — законные основания для использования данных плюс режим базы данных в ЕС; интерфейс и бренд — авторское право, дизайн-патенты, товарные знаки.

Due diligence AI-компаний устроен сложнее, чем due diligence обычного IT-актива. Юристу, который готовит такую сделку, важно разобраться в структуре продукта и проверить, реально ли работает защита на каждом уровне — а не полагаться на один правовой механизм. Если где-то защита слабая — например, веса хранятся без шифрования и доступны широкому кругу сотрудников, — это повод менять структуру сделки: добавлять заверения, расширенное возмещение убытков и отложенную часть оплаты.