Автор: Олег Ремизов, дата публикации на сайте: 20 августа 2026 года
На мой взгляд у этой истории получается какая-то почти идеальная авиационная метафора. IT гиганту Google понадобился так сказать черный ящик или цифровой самописец целой авиакомпании за много лет. 19 августа отраслевое издание Paddle Your Own Kanoo написали статью, что Google победила на аукционе по продаже данных Spirit Airlines, которая к тому моменту прекратила полёты. Сумма предложения составила аж 10 миллионов долларов, второе предложение от Mercor остановилось на 7,5 миллиона. Google сообщила, что массив может пригодиться для развития продуктов и обучения моделей ИИ. Но сделка еще не случилась из-за возражения профсоюза бортпроводников и суд перенёс рассмотрение результатов на 9 сентября.
Я с большим интересом кликнул в судебную опись активов, и там прямо прямо масштаб. В набор данных входят около 100 миллионов писем, 500 миллионов объектов корпоративного мессенджера Microsoft Teams, 17 миллионов файлов OneDrive, больше 20 миллионов объектов SharePoint, 667 тысяч IT-заявок и примерно пять миллионов записей о связках рейсов для экипажей. Рядом лежат сведения об обучении сотрудников, расписании, сбоях, ценах, бронированиях, платежах, техническом обслуживании и исходный код внутренних систем. И конечно же есть пассажирские профили, программа лояльности, телефонные номера, записи звонков и сервисные чаты в таблице отмечены как не входящие в продажу. Получается довольно таки подробный слепок того, как была устроена авиакомпания.
В недавней заметке про врачей и искусственный интеллект я писал о том, как модель собирает ответ из уже опубликованных источников. Здесь интересна обратная сторона. Моделям понадобилось то, чего в открытом интернете почти нет, внутренняя последовательность работы большой компании за много лет. Самих текстов Google и без Spirit Airlines, думаю, хватает в текущее время. Ценность не в объёме переписки, а в связях между событием, обсуждением, решением и результатом. Письмо можно сопоставить с изменением расписания, перестановкой экипажа, обращением в IT, фактической задержкой и её стоимостью. И тогда корпоративный архив или корпоративный черный ящик превращается в почти готовый учебный материал. Каждый эпизод можно разложить по времени. Что было запланировано, какой сигнал появился, кто и что обсуждал, какое решение приняли, чем всё закончилось и были ли последствия или зависимости на другие ветки бизнеса. Это ещё не сразу доказывает причинную связь, но позволяет находить повторяющиеся сочетания, строить гипотезы и проверять их на других периодах и бизнесах. ИИ может оценивать вероятность задержки, замечать необычную последовательность событий, прогнозировать следующий шаг или ранжировать несколько вариантов восстановления расписания.
Скорее всего, никто не будет просто загружать весь архив в одну огромную модель и ждать озарения. Часть материалов можно использовать как поисковую базу, часть для дообучения под конкретные задачи, часть для прогнозов и тестирования качества. В собственном руководстве Google Cloud отдельно описывает работу с корпоративными данными через поиск с подстановкой контекста и через дообучение на размеченных примерах. В случае Spirit Airlines особенно ценна связность. Таблица показывает, что произошло, а переписка иногда объясняет, почему люди выбрали именно такой вариант.
В авиации из этого можно собрать очень практичные инструменты. Ассистент операционного центра получает задержанный рейс, экипаж, который выбыл из цепочки, и самолёт не в том аэропорту. Он находит похожие случаи, сравнивает замену борта, перестановку экипажей и перебронирование пассажиров, затем оценивает последствия для следующих рейсов. Модель планирования может искать хрупкие связки ещё до начала сбоя. Система управления доходами может сопоставлять изменения тарифов с кривой бронирования. IT-ассистент может связать заявку, обсуждение, изменение кода и реальный результат после исправления. Это получается быстрый и эффективный способ сузить число вариантов, которые человеку всё равно придётся проверить. Google не сообщала о планах на эти продукты, поэтому это моё предположение по составу данных. Но направление не выглядит фантазией. В опубликованном кейсе SWISS использует Google Cloud, чтобы собирать почти поминутную картину работы авиакомпании и просчитывать разные операционные сценарии. В другом проекте я увидел, что Lufthansa и Google обучали модель прогнозировать сложный ветер в Цюрихе и получили более чем 40-процентное относительное улучшение точности по сравнению с внутренними эвристиками. Архив Spirit Airlines добавляет к операционным цифрам ещё и историю человеческих решений.
Отдельно меня удивили 500 миллионов объектов Teams. Я бы всё же не переводил эту цифру как 500 миллионов содержательных сообщений. Там наверняка много коротких ответов, системных записей, вложений, повторов и обычной цифровой рабочей болтовни на тему куда пойдем на обед. Но даже после очистки остаётся огромная хронология того, как компания говорит сама с собой.И кстати есть небольшая ирония в том, что Google хочет получить гигантскую летопись корпоративной жизни, созданную внутри Microsoft 365.
Возражение профсоюза бортпроводников при этом кажется мне вполне понятным. Удалить имя сотрудника не значит удалить конфиденциальность содержания. Дата, база экипажа, редкий случай на обучении, конкретная связка рейсов и изменение выплаты вместе могут сузить круг до нескольких человек. В заявлении AFA отдельно отмечено, что договор требует сохранить связи между записями в разных системах. Для модели это почти главное достоинство массива. Для приватности это же становится главным риском. Рекомендации NIST тоже рассматривают деидентификацию как снижение риска, а не как волшебное исчезновение возможности узнать человека. Самый неудобный вопрос здесь даже не технический. Сотрудники писали письма и сообщения, чтобы выпустить рейсы, закрыть смены, решить спор и починить систему. Они явно не подписывались создавать учебный набор для ИИ модели. Корпоративная переписка и раньше хранилась в системах компании, но теперь у этой памяти появилась отдельная цена и вполне реальный рынок и главное потребность. Политика работы с данными должна отвечать уже не только на вопросы хранения и доступа, а нужны ответы о том, кто вправе обучать на архиве модели, что происходит после банкротства и какие рабочие материалы вообще допустимо продавать дальше. На эту тему нужно будет подумать отдельно, это конечно интересный кейс.
Для меня эта история как раз находится на стыке авиации и цифровых технологий. В авиации «чёрный ящик» помогает восстановить несколько часов полёта. Google заинтересовала чёрная коробка всей компании, где записаны годы решений, сбоев, споров и попыток удержать расписание. Самолёты, слоты и запчасти после закрытия перевозчика продают давно. Теперь цену получила ещё и память о том, как тысячи людей пытались сделать так, чтобы эти самолёты продолжали летать. Новая реальность в том, что данные о том, как работала компания, становятся таким же активом, как её самолёты, слоты или технологии.
Об авторе: Олег Ремизов — автор независимого проекта о гражданской авиации, путешествиях и пассажирском опыте. Он снимает подробные видеообзоры перелётов и пишет о работе авиакомпаний и аэропортов, сервисе, маршрутах и цифровых решениях для пассажиров.
