Оценка AI-актива в M&A: чем она отличается от оценки ПО
Покупка AI-компании требует существенно более глубокого due diligence, чем приобретение классического разработчика программного обеспечения. Помимо проверки прав на исходный код, инвестору необходимо оценить права на модель, обучающие данные, веса модели, инфраструктуру обучения, соблюдение требований EU AI Act, GDPR и условий лицензирования.
В этой статье разбираем основные юридические вопросы, которые необходимо проверить перед приобретением AI-бизнеса.
Каковы ключевые различия AI-актива и обычного программного обеспечения? На что обратить внимание при подготовке к сделке с AI-таргетом, даже если по форме такая сделка мало отличается от типового приобретения долей или cash-in-инвестирования?
Давайте разберемся.
Материал будет полезен инвесторам, фондам, корпоративным покупателям, основателям AI-стартапов, разработчикам генеративного AI и юридическим департаментам технологических компаний.
Из чего состоит AI-продукт: четыре самостоятельных элемента
С юридической точки зрения
В обычной IT-сделке фокус при оценке интеллектуальной собственности смещен на исходный код продукта. На код возникают авторские права, которые, в зависимости от юрисдикции, либо передаются работодателю/заказчику по трудовому договору или же заказу, либо сразу возникают у компании (например, в американской модели work for hire). Одновременно код может защищаться режимом коммерческой тайны и оформленными обязательствами о конфиденциальности с работниками и контракторами. К этому часто добавляются товарные знаки на бренд, лицензии на используемые компоненты с открытым исходным кодом и патенты на отдельные технические решения. Совокупно перечисленные инструменты образуют объем охраны классического программного продукта, который и проверяет инвестор на этапе due diligence.
Но если речь идет об AI-продукте, просто проверить, перешли ли права на код таргету или зарегистрирован ли товарный знак, недостаточно. На практике в составе AI-продукта обычно выделяют четыре самостоятельных элемента, каждый из которых по-своему регулируется и охраняется законом:
- Архитектура модели
Это описание самой конструкции нейросети: сколько в ней слоев, какие математические операции применяются и как они соединены между собой. На практике большинство архитектур, лежащих в основе современных AI-продуктов, описаны в открытых научных публикациях (например, архитектура transformer лежит в основе языковых моделей семейства GPT и Claude, а сверточные нейронные сети составляют основу систем распознавания изображений). Это означает, что сама архитектура, как правило, не представляет ключевой ценности, а потому акцент в оценке смещается на следующие три элемента.
- Веса модели (model weights)
Конкретные числовые значения параметров нейросети, полученные в результате ее обучения. Если архитектура задает «форму» модели, то веса фиксируют ее «знания», выраженные в миллиардах чисел, которые отвечают за то, как модель реагирует на тот или иной запрос. Именно в весах сосредоточена основная экономическая ценность AI-продукта.
- Датасеты (data sets)
Наборы данных, на которых модель обучалась, на которых проверялось качество ее работы и на которых она впоследствии может дообучаться. От качества и происхождения датасета напрямую зависят и поведение модели, и юридические риски, связанные с ее использованием.
- Инфраструктура и пайплайн обучения
Внутренние инструменты, скрипты и настройки, благодаря которым модель можно повторно обучить или развить без необходимости выстраивать заново архитектуру. Без этой составляющей покупатель получает «модель в моменте», но не получает возможности ее развивать после закрытия сделки.
Стадии создания модели и их регуляторные особенности
На каждой из стадий возникают разные риски и применяются разные правовые режимы. Не учитывая стадию, не получится корректно квалифицировать, что именно компания «делала с моделью» (и, соответственно, что именно она передает инвестору по сделке).
- Стадия первичного обучения (pre-training)
На этой стадии модель обучается «с нуля» на большом массиве данных и приобретает «общие знания», например способность работать с языком или распознавать предметы. Pre-training ресурсоемкий и одновременно наиболее рискованный с точки зрения правомерности использования данных. Как правило, AI-продукты проходят эту стадию у самих разработчиков моделей.
- Стадия дообучения (fine-tuning)
На этой стадии готовая модель «доучивается» под конкретную задачу или вертикаль, например на массиве медицинских заключений или юридических документов. Именно fine-tuning чаще всего становится предметом спора в M&A-сделках со средним сегментом AI-компаний: поскольку без предоставленных клиентом документов модель не смогла бы дообучиться, разработчик уже не обладает всем результатом дообучения в полной мере.
- Стадия применения модели (inference)
Это стадия эксплуатации, на которой модель применяется к запросам пользователей. Самой по себе тренировки здесь не происходит, но возникают свои риски, в первую очередь связанные с обработкой данных, которые передают пользователи, и с тем, насколько результат работы модели может воспроизводить охраняемый чужой контент.
Обратите внимание!
| Между стадиями дообучения и применения существует промежуточная зона — методы, при которых модель не дообучается заново, но «расширяется» внешней базой знаний. Одним из таких подходов является RAG (Retrieval-Augmented Generation), при котором модель в момент ответа обращается к подключенной базе документов компании. Внешне это выглядит как «AI, который знает ваш продукт», но юридически это ближе к обработке данных, чем к созданию собственной модели. При оценке таргета это разграничение принципиально: компания, использующая RAG, не является разработчиком модели в правовом смысле, и описывать ее в сделке как «AI-разработчика» некорректно. |
Веса модели как самостоятельный актив в сделке
Веса современной языковой модели — набор файлов с миллиардами числовых параметров общим объемом от сотен мегабайт до сотен гигабайт. Без архитектуры эти числа сами по себе бесполезны, однако именно в них «закодирован» весь полезный результат обучения. Если веса известны, исходный продукт несложно скопировать.
Какие способы защиты применимы к весам
Ни в ЕС, ни в США сегодня нет специально сформированного режима охраны параметров обученной модели.
На практике защита выстраивается путем комбинирования уже существующих механизмов.
- Авторское право
В США U.S. Copyright Office последователен в позиции, согласно которой правовая охрана предоставляется при наличии творческого вклада человека. Параметры модели, по существу, формируются автоматически в ходе оптимизации, поэтому суды и регуляторы рассматривают их скорее как результат вычислений, чем как охраняемое произведение. В ЕС позиция не такая жесткая: теоретически возможно отнесение весов к компьютерной программе или к базе данных, однако судебная практика по этому вопросу пока не сформирована, и опираться на эту квалификацию в сделке преждевременно.
- Коммерческая тайна (trade secret)
В отношении моделей с закрытыми весами это сегодня основной работающий режим. И в США, и в ЕС определение коммерческой тайны охватывает информацию, имеющую коммерческую ценность ввиду ее неизвестности третьим лицам, при условии, что владелец принимает разумные меры по сохранению ее конфиденциальности. Параметры модели по своему характеру под это определение подходят. Существенное ограничение: режим прекращается в момент публикации актива. Поэтому модели с открытыми весами, например Llama от Meta, Mistral, Falcon, этот режим теряют, и единственным IP-активом, по сути, остаются условия лицензии.
- Контрактные ограничения
После того, как режим коммерческой тайны теряется вследствие раскрытия — при разворачивании на серверах клиента или при предоставлении расширенного доступа через API — регулировать использование весов можно с помощью договоров. Договором устанавливаются прямые запреты на копирование, на reverse engineering (там, где это имеет смысл), на дистилляцию (создание новой модели на outputs исходной) и на передачу третьим лицам, а также ограничения по сферам и сценариям применения. В ситуации, когда коммерческая тайна формально ослабевает из-за того, что клиенты получают доступ к модели, именно контрактные условия в значительной части закрывают эту часть «ослабления».
Что это означает для инвестора
Когда покупатель приобретает AI-компанию, формулировки о «передаче всех прав на программное обеспечение» применительно к весам недостаточно. Если суд впоследствии не признает веса «программой» в смысле применимого закона (например, в США такая вероятность высока), покупатель может оказаться в ситуации, при которой переданный продукт фактически защищен только режимом коммерческой тайны, а его сохранение, в свою очередь, зависит от того, поддерживает ли сам покупатель необходимый уровень конфиденциальности.
Рекомендуем: при подготовке к сделке с AI-таргетом включать в документы сделки отдельный технический перечень передаваемых составляющих — с указанием по каждой из них применимого режима охраны (коммерческая тайна, авторское право, контрактные ограничения, открытая лицензия), места хранения (репозитории, облачные хранилища, контрольные суммы версий), условий применимых open-source лицензий. Такой перечень одновременно становится приложением к заверениям и гарантиям продавца и облегчает фактическую передачу актива после закрытия сделки.
Кому принадлежит модель, обученная на чужих данных
Этот вопрос — один из наиболее острых в AI-сделках 2024–2026 годов.
В обучении почти любой современной модели использовались данные, на которые у компании не было прямой лицензии: материалы из открытых интернет-источников, контент с пользовательскими лицензиями (Creative Commons и аналоги), а в отдельных случаях — данные сомнительного или прямо нелегального происхождения. Отвечая на этот вопрос, нужно выяснить: является ли само использование таких данных при обучении нарушением и переходит ли связанный с этим риск к покупателю вместе с моделью.
Подход США: доктрина fair use и формирующаяся судебная практика
В США основной защитой AI-компаний выступает доктрина добросовестного использования (fair use) — режим, при котором определенное использование охраняемого материала допускается без разрешения правообладателя, если это оправдано целями использования и его характером. Применительно к обучению AI-моделей эта доктрина в данный момент проходит проверку в нескольких знаковых судебных делах.
Так, в инициированном в 2023 году деле The New York Times v. OpenAI & Microsoft газета предъявила претензии к разработчикам, использовавшим в обучении ее статьи. Истец утверждал, что модель в отдельных случаях дословно воспроизводила фрагменты публикаций. Если в этом деле будет применен прецедент Верховного суда (Andy Warhol Foundation for the Visual Arts, Inc. v. Goldsmith), то обучение на статьях без лицензии будет признано нарушением. Суть прецедента в том, что использование «копии» с той же коммерческой целью, с которой использовался оригинал (в случае OpenAI речь может идти о предоставлении новостной информации пользователям, что было и исходной целью газеты), не подпадает под режим fair use и является нарушением. Цель OpenAI (предоставлять новостную информацию пользователям) совпадает с целью самой газеты (тоже предоставлять новости). Если суд признает, что OpenAI должна была купить лицензию, то «бесплатное» обучение перестанет считаться добросовестным, ведь оно лишает правообладателей их законного дохода от продажи прав на обучение.
В деле Bartz v. Anthropic, по которому промежуточное решение вынесли в июне 2025 года, суд провел важное для рынка разграничение: обучение модели на легально приобретенных книгах было квалифицировано как добросовестное использование, тогда как формирование обучающего корпуса за счет пиратских копий – как нарушение, не покрываемое fair use.
Поскольку fair use — не факт, который подтверждался бы заверением, а правовая позиция, которую компания может заявить при предъявлении претензий, не стоит включать в SPA заверение о том, что обучение «было добросовестным использованием».
Однако такое заверение можно дать в отношении конкретного происхождения обучающих данных и того, что компания не использовала очевидно нелегальные источники.
Рекомендуем: при покупке или инвестициях в AI-компанию на стадии due diligence изучите подробно происхождение каждого крупного блока обучающих данных, оценив, какие категории претензий теоретически могут быть к нему предъявлены. Выявленные риски фиксируйте в специальных условиях SPA — отдельных или fundamental заверениях и расширенном возмещении убытков.
Подход Европейского союза: исключения для анализа данных и регуляторные обязательства
Европейский подход к обучению AI на чужих данных опирается не столько на судебную практику, сколько на прямые нормы права. Директива Европейского союза о едином цифровом рынке (DSM Directive) предусматривает специальные исключения, позволяющие осуществлять анализ больших массивов данных (text and data mining, то есть автоматическую обработку текстов и данных в целях извлечения закономерностей). Для научных целей это можно делать без ограничений, а для коммерческих — при условии, что правообладатель не выразил отказ от такого использования в машиночитаемой форме, например через специальные пометки на сайте. Именно на это исключение опирается сегодня большинство европейских AI-разработчиков.
В сентябре 2024 года в немецком суде было вынесено первое значимое решение (LAION v. Kneschke), подтвердившее, что некоммерческое исследовательское использование данных AI-сообществом может опираться на это исключение, тогда как для коммерческого использования должны соблюдаться отказы правообладателей.
Регламент ЕС об искусственном интеллекте (EU AI Act) закрепляет за разработчиками крупных моделей самостоятельные обязанности, в том числе обязует их раскрывать общую характеристику использованных при обучении данных и иметь внутреннюю политику соблюдения авторских прав. Невыполнение этих требований становится самостоятельным регуляторным риском, который теперь нужно учитывать при оценке AI-таргета.
Дополнительный слой риска: персональные данные в обучении
Если в обучающем массиве присутствовали персональные данные (а для текстовых моделей, обученных на массиве данных из интернета, это практически всегда так), на сделку накладывается GDPR — европейский режим защиты персональных данных.
Основная сложность связана с тем, что закрепленное за гражданами право на удаление данных непросто исполнить в отношении уже обученной модели: «отучить» модель от конкретных данных невозможно без ее существенного переобучения.
Именно вокруг этого противоречия в 2024-2025 годах формируется практика европейских регуляторов: так, в декабре 2024 года итальянский регулятор Garante вынес OpenAI крупный штраф на сумму 15 млн евро именно по основаниям, связанным с обработкой персональных данных при обучении.
Обратите внимание: при подготовке к сделке с AI-таргетом проверка соблюдения режима персональных данных в части обучения часто оказывается недооцененной. Стандартный аудит обработки персональных данных, как правило, проверяет работу с данными клиентов в продукте, но может не обратить внимание на происхождение обучающих данных.
Дообучение модели: кто претендует на права
Дообучение — стадия, на которой пересекаются интересы максимального числа сторон, и именно она требует наибольшей договорной точности.
Когда компания A берет готовую базовую модель от компании B и дообучает ее на своем датасете, на выходе по сути получается новая модель, ведь у базовой модели теперь есть «надстроенный» слой знаний. Претендовать на права на такую новую модель в зависимости от структуры отношений могут сразу несколько сторон: разработчик базовой модели — через положения своей лицензии; компания A — как сторона, проводившая дообучение («доработку» в терминах авторских прав на ПО); поставщик датасета — как составитель базы данных, если набор данных не был собран самой компанией A; и, наконец, клиент компании A — если дообучение проводилось на его данных и по договору права на результат принадлежат ему как заказчику.
|
На практике такая структура представляет собой сложный «клубок» потенциальных прав и обязанностей, распутать который — обязательное условие при подготовке сделки. |
Типичный риск: данные клиентов в обучении
Очень распространена конструкция, при которой разработчик модели «улучшает ее на агрегированных данных всех клиентов», а права на эти улучшения остаются у разработчика. Такая конструкция сегодня находится под двойным давлением: как со стороны режима персональных данных (ведь правовое основание для использования таких данных в обучении вызывает вопросы), так и со стороны самих клиентов (когда они узнают, что их конфиденциальная информация фактически использовалась для общего продукта).
При подготовке к сделке необходимо ознакомиться со всеми клиентскими договорами и ответить на конкретный вопрос:
|
«В каком объеме клиентские данные могли попасть в обучение модели и есть ли у компании внятная договорная и регуляторная основа для использования полученных в результате улучшений?» |
Отсутствие явного согласия клиента, замаскированное в стандартных условиях обслуживания, это типичный риск, который при недобросовестных конкурентах или активном регуляторе может реализоваться уже после закрытия сделки.
On-premise vs SaaS: разные риски сделки
Способ дистрибуции AI-продукта прямо влияет на распределение рисков в сделке. Один и тот же продукт может оцениваться по-разному в зависимости от того, как он распространяется.
- Под SaaS-моделью (Software as a Service — программное обеспечение, предоставляемое как услуга) понимается сценарий, при котором веса модели физически остаются у разработчика, а клиент получает только доступ к ее работе через интернет (отправляет запрос, получает ответ). Сами параметры модели клиенту никогда не передаются. По такой схеме работают, например, OpenAI API, Anthropic API, Google Vertex и большинство современных AI-стартапов «по умолчанию».
- Под on-premise-моделью понимается сценарий, при котором модель разворачивается в инфраструктуре самого клиента. В такой модели клиент чаще всего получает фактический доступ к параметрам модели и может использовать ее автономно. По такой схеме работают многие корпоративные языковые модели, защищенные медицинские модели, отраслевые решения в финансовом секторе и оборонной промышленности.
Что клиент покупает в каждом сценарии
В обеих ситуациях основным активом остаются параметры модели и инструменты ее обучения, однако баланс рисков будет различаться.
- В сценарии SaaS модель не покидает контур разработчика. Поэтому ключевой риск связан с компрометацией внутренней среды (доступы инсайдеров, инциденты безопасности) и с устойчивостью клиентской базы. Соответственно, при подготовке к сделке с таким таргетом особое внимание уделяется состоянию информационной безопасности: сертификации (например, ISO 27001, SOC 2), системе управления доступом, журналам действий, а также договорам с ключевыми клиентами и условиям обработки их данных.
- В сценарии On-premise актив фактически выходит за периметр компании при каждой продаже. Ключевой риск смещается в плоскость лицензирования: ушедший клиент, обладающий копией модели, потенциально становится конкурентом. В этой связи существенными будут условия лицензионных соглашений: наличие в них прямых запретов на дистилляцию и на передачу модели третьим лицам, а также наличие технических средств защиты, например привязки модели к конкретному оборудованию.
Важно: при on-premise-распространении режим коммерческой тайны для весов фактически ослабевает с каждой новой клиентской установкой. Если в ходе оценки таргета выясняется, что лицензии у клиентов составлены слабо, технические средства защиты не применяются, а контрактного запрета на дистилляцию нет, заявление компании о том, что веса охраняются как коммерческая тайна, становится недостоверным.
Особый случай: продукты на чужих базовых моделях
Отдельная категория AI-таргетов — компании, чей продукт построен поверх API крупных провайдеров (OpenAI, Anthropic, Google). С технической стороны такой продукт представляет собой прежде всего набор инструкций для модели (prompt engineering), подключенную базу знаний клиента и пользовательский интерфейс.
С юридической стороны главный актив здесь — не веса модели (они принадлежат провайдеру), а контракт с провайдером, накопленные методики работы с моделью и пользовательские данные.
При оценке такой компании критично обращать внимание на установленные провайдером условия использования базовой модели.
Так, корпоративные условия OpenAI прямо запрещают использование результатов работы их моделей для обучения конкурентов и устанавливают ограничения для перепродаж. Параллельно следует оценивать риск быть привязанным к конкретному поставщику: в какой мере архитектуру продукта удастся перенести на другую модель при изменении провайдером своей политики или цен?
Лицензии на модели с открытыми весами: внимательное чтение условий
Когда таргет использует Llama, Mistral, Falcon или Stable Diffusion, текст лицензии заслуживает отдельного внимания: за внешней формой open source нередко скрываются существенные коммерческие ограничения.
Так, у Llama при превышении 700 миллионов активных пользователей в месяц, лицензия прямо запрещает «улучшение других больших языковых моделей путем дистилляции» и устанавливает обязательные требования к атрибуции. У Falcon (TII) применяется чистая лицензия Apache 2.0. У моделей Mistral лицензия зависит от конкретной версии — от Apache 2.0 для одних до Mistral Research License с ограничениями на коммерческое использование для других. У Stable Diffusion применяется лицензия с прямыми ограничениями по сценариям использования.
Если в ходе оценки выясняется, что таргет нарушает условия лицензии базовой модели, это может существенно повлиять на сделку: правообладатель вправе отозвать лицензию, фактически лишив ключевой актив коммерческой ценности.
Какие способы защиты действительно работают
Авторское право — работает лишь для классического ПО
- Сама архитектура модели (математическое описание ее устройства) авторским правом не охраняется ни в США, ни в ЕС. Если архитектура опубликована в научной статье, она в значительной мере становится общедоступной.
- Исходный код обучающей и эксплуатационной инфраструктуры, включая скрипты обучения, инструменты внутреннего администрирования, инструменты управления жизненным циклом моделей (MLOps-системы) — это классическое программное обеспечение. Здесь авторское право работает в полном объеме, как у обычной IT-компании.Веса являются одной из спорных зон. Так, в США охрана авторским правом крайне ограничена, а в ЕС теоретически возможна, но не подтверждена практикой.
- Датасеты охраняются на двух уровнях. Отдельные элементы датасета могут охраняться как самостоятельные объекты авторского права (компания не получает авторских прав на чужие тексты или изображения, попавшие в ее обучающий массив). Сам датасет как составной объект может охраняться как собрание (compilation) в США или как база данных в ЕС, при условии, что в его создание вложены значительные инвестиции.
- Результаты работы модели. В США в чистом виде авторским правом не охраняются; в ЕС подходы варьируются по странам, но движутся в ту же сторону.
Коммерческая тайна как основной режим и ее уязвимость
Мы убедились, что охрана авторским правом в отношении ключевых составляющих AI-продукта ограничена. Поэтому чаще всего AI охраняется как коммерческая тайна, в особенности — веса и инфраструктура обучения. Преимущества этого режима: он не требует регистрации, охватывает разнородные элементы (от весов до отдельных параметров обучения), не имеет срока действия и работает в большинстве юрисдикций.
Условие сохранения режима коммерческой тайны — наличие у компании «разумных мер по обеспечению конфиденциальности». Именно эта формулировка задает направление проверки при подготовке к сделке.
В работающей AI-компании должны быть:
- формализованная система разграничения доступа с журналированием действий;
- обязанности по конфиденциальности в трудовых договорах сотрудников, имеющих доступ к коду и моделям;
- соглашения о неразглашении со всеми контрагентами, имевшими доступ к ключевым компонентам;
- маркировка систем хранения как конфиденциальных;
- отлаженный порядок отзыва доступов при увольнении сотрудников и процедуры реагирования на инциденты;
- политика участия работников в самостоятельных open-source проектах.
|
При отсутствии этих элементов заявление компании о том, что ее модели охраняются режимом коммерческой тайны, не имеет практического подтверждения, и покупатель приобретает актив, юридически не защищенный. |
Заключение
Универсального режима охраны для AI-продукта сегодня не существует. На практике каждая компания выстраивает многоуровневую систему защиты, в которой каждый уровень страхует другой.
Архитектура и общие методы могут охраняться режимом коммерческой тайны или ноу-хау. Исходный текст — авторским правом и условиями open-source лицензий. Веса — режимом коммерческой тайны и контрактными условиями, а при on-premise-распространении — дополненными техническими средствами защиты (шифрование, привязка к оборудованию). Для датасетов сработают законные основания для использования данных (исключения для анализа данных, лицензии, добросовестное использование) плюс специальный режим базы данных в ЕС. Для пользовательского интерфейса и брендинга подойдут авторское право, дизайн-патенты и товарные знаки.
Due diligence AI-компаний становится более сложным и комплексным процессом. Поэтому юрист, готовящий такую сделку, должен глубоко погрузиться в структуру продукта, проверить, обеспечен ли каждый уровень защиты реально, и не делать ставку лишь на один режим или правовой механизм. Если на каком-то уровне защита оказывается слабой (например, веса хранятся в открытом виде, без шифрования и с широким кругом сотрудников, имеющих к ним доступ), это становится самостоятельным аргументом для структурирования сделки с дополнительными заверениями, расширенным возмещением и отложенной частью оплаты.
Авторы: Инна Семенова и Егор Кулаженко.
Материал подготовлен для стороннего медиа: medium.com
Чем может помочь REVERA
Планируете приобрести AI-компанию, привлечь инвестиции или провести юридическую проверку AI-продукта?
Команда REVERA сопровождает международные M&A-сделки, инвестиции в технологические компании и комплексный AI Due Diligence, включая анализ интеллектуальной собственности, обучающих данных, лицензий, требований EU AI Act и GDPR.
Если вы рассматриваете сделку с AI-бизнесом, наши специалисты помогут выявить юридические риски до подписания документов и предложат оптимальную структуру сделки.
Обсудить AI Due Diligence
Получить консультацию по AI-сделке