Многомиллиардный узкий момент AI: качественные данные, а не модель | Мнение
AI может стать следующей индустрией с триллионным оборотом, но она тихо приближается к серьезному узкому месту. Пока все стремятся создавать более крупные и мощные модели, надвигающаяся проблема остается в основном без внимания: уже через несколько лет мы можем столкнуться с нехваткой пригодных для использования обучающих данных.
- У AI заканчивается топливо: обучающие датасеты увеличиваются в объеме в 3,7 раза ежегодно, и мы можем исчерпать мировой запас качественных публичных данных между 2026 и 2032 годами.
- Рынок разметки данных стремительно растет: с $3,7 млрд (2024) до $17,1 млрд (2030), в то время как доступ к реальным человеческим данным сокращается из-за закрытых экосистем и регулирования.
- Синтетических данных недостаточно: обратные связи и отсутствие реальных нюансов делают их рискованной заменой "грязным", созданным человеком данным.
- Власть переходит к держателям данных: по мере того как модели становятся товаром, настоящим отличием будет владение и контроль уникальными, высококачественными датасетами.
По данным EPOCH AI, объем обучающих датасетов для крупных языковых моделей с 2010 года увеличивается примерно в 3,7 раза ежегодно. При таком темпе мы можем исчерпать мировой запас высококачественных публичных обучающих данных где-то между 2026 и 2032 годами.
Даже до того, как мы столкнемся с этим пределом, стоимость получения и разметки данных уже стремительно растет. Рынок сбора и разметки данных оценивался в $3,77 млрд в 2024 году и, по прогнозам, увеличится до $17,10 млрд к 2030 году.
Такой взрывной рост указывает на очевидную возможность, но и на явное узкое место. AI-модели настолько хороши, насколько хороши данные, на которых они обучаются. Без масштабируемого потока свежих, разнообразных и непредвзятых датасетов производительность этих моделей достигнет плато, а их полезность начнет снижаться.
Так что настоящий вопрос — не кто создаст следующую великую AI-модель. А кто владеет данными и откуда они будут поступать?
Проблема данных в AI больше, чем кажется
Последнее десятилетие инновации в AI во многом опирались на общедоступные датасеты: Wikipedia, Common Crawl, Reddit, открытые репозитории кода и многое другое. Но этот источник быстро иссякает. По мере того как компании ужесточают доступ к своим данным, а вопросы авторских прав накапливаются, AI-компании вынуждены пересматривать свой подход. Правительства также вводят регулирование, ограничивающее сбор данных, а общественное мнение меняется в сторону неприятия идеи обучения моделей стоимостью в миллиарды долларов на бесплатном пользовательском контенте.
Синтетические данные — одно из предлагаемых решений, но это рискованная замена. Модели, обученные на данных, сгенерированных другими моделями, могут приводить к обратным связям, галлюцинациям и ухудшению производительности со временем. Есть и вопрос качества: синтетические данные часто лишены "грязи" и нюансов реального мира, а именно это необходимо AI-системам для эффективной работы в практических сценариях.
В результате именно реальные, созданные человеком данные остаются золотым стандартом, и их становится все труднее получить. Большинство крупных платформ, собирающих человеческие данные, такие как Meta, Google и X (ранее Twitter), представляют собой закрытые экосистемы. Доступ ограничен, монетизирован или полностью запрещен. Более того, их датасеты часто смещены в сторону определенных регионов, языков и демографических групп, что приводит к предвзятым моделям, не справляющимся с разнообразными задачами реального мира.
Короче говоря, индустрия AI вот-вот столкнется с реальностью, которую она долго игнорировала: построить огромную LLM — это только половина дела. Вторая половина — это ее "кормление".
Почему это действительно важно
В цепочке создания ценности AI есть две части: создание моделей и получение данных. Последние пять лет почти все инвестиции и внимание были сосредоточены на создании моделей. Но по мере того как мы приближаемся к пределам их размера, внимание наконец смещается ко второй половине уравнения.
Если модели становятся товаром — с открытыми альтернативами, компактными версиями и аппаратно-эффективными решениями — то настоящим отличием становятся данные. Уникальные, высококачественные датасеты будут топливом, определяющим, какие модели окажутся лучшими.
Они также открывают новые формы создания ценности. Вкладчики данных становятся заинтересованными сторонами. Разработчики получают доступ к более свежим и динамичным данным. А предприятия могут обучать модели, которые лучше соответствуют их целевой аудитории.
Будущее AI принадлежит поставщикам данных
Мы вступаем в новую эру AI, где тот, кто контролирует данные, обладает реальной властью. По мере того как конкуренция за обучение лучших, умнейших моделей усиливается, главным ограничением будет не вычислительная мощность. Это будет поиск данных, которые реальны, полезны и легальны для использования.
Теперь вопрос не в том, сможет ли AI масштабироваться, а в том, кто обеспечит этот масштаб. Это будут не только data scientists. Это будут хранители данных, агрегаторы, вкладчики и платформы, которые их объединяют. Именно здесь лежит следующий рубеж.
Так что в следующий раз, когда вы услышите о новом прорыве в искусственном интеллекте, не спрашивайте, кто построил модель. Спросите, кто ее обучал и откуда взялись данные. Потому что в конечном итоге будущее AI — это не только архитектура. Это — входные данные.
Max Li — основатель и CEO OORT, облачного сервиса данных для децентрализованного AI. Dr. Li — профессор, опытный инженер и изобретатель с более чем 200 патентами. Его опыт включает работу над системами 4G LTE и 5G в Qualcomm Research, а также академические публикации по теории информации, машинному обучению и технологии blockchain. Он автор книги “Reinforcement Learning for Cyber-physical Systems”, изданной Taylor & Francis CRC Press.
Дисклеймер: содержание этой статьи отражает исключительно мнение автора и не представляет платформу в каком-либо качестве. Данная статья не должна являться ориентиром при принятии инвестиционных решений.
Вам также может понравиться
Хедж-фонды только что восстановили длинные позиции в технологиях, но ключевая поддержка Nasdaq уже начинает ослабевать
Индекс Nasdaq 100 приближается к нижней границе многомесячного бокового диапазона, фьючерсы пробили линию восходящего тренда и 100-дневную скользящую среднюю, техническая карти на ослабла. Хедж-фонды ранее активно покупали технологические акции, концентрация позиций увеличивает риск снижения. Споры вокруг безопасности искусственного интеллекта и риски энергоснабжения создают двойной катализатор. Если ключевая поддержка будет утрачена и паника на рынке останется низкой, вероятна переоценка волатильности.
Десятилетняя доходность американских казначейских облигаций превысила 5%! "Пророк" предупреждает: Распродажа ещё не закончилась
Руководитель отдела стратегий G10 в Standard Bank Стивен Барроу, который первым в этом году в феврале предсказал доходность 10-летних казначейских облигаций на уровне 5%, повысил свой прогноз до 5,2% к концу года и ожидает дальнейшего повышения до 5,3% в первом квартале 2027 года. Он отметил, что давление на цепочки поставок, изменения климата, а также ограничения миграционной политики США на предложение рабочей силы становятся сильнее, чем когда-либо раньше. Индекс доллара за день вырос максимум на 0,6%, что может стать его лучшим однодневным результатом с 17 июня.
Продвигается вопреки буре «замедления AI»? Сообщается, что Kioxia планирует IPO в США с привлечением как минимум 10 миллиардов долларов.
Согласно сообщениям, Kioxia рассматривает возможность привлечения 10 миллиардов долларов путем размещения акций в США.

Строительство вычислительных мощностей AI переходит от "дефицита электроэнергии" к "дефициту кадров": рост модульных решений, новые возможности для Schneider, Vertiv, Eaton
Bernstein недавно опубликовал аналитический отчет, в котором отмечается, что на фоне быстрого расширения вычислительной мощности AI происходит изменение основных ограничивающих факторов развития дата-центров.

