Они не могут без нас… пока что

Сервис ISBNdb, объединяющий метаданные 113 млн изданий, предложил ИИ-компаниям специфическую услугу: закупку книг партиями до миллиона штук с последующей оцифровкой и утилизацией. Когда об этой схеме написали СМИ, компания поспешила удалить страницу с описанием услуги и заявила, что никаких сделок не заключала. Как утверждают ее представители, речь шла лишь о «проверке рыночного спроса».

В другом сегменте рынка платформы ActID и New Claw готовы платить людям от $15 до $700 за право использовать их лица как основу для персонажей ИИ-сериалов и рекламы. ForkLog разобрался, для чего лаборатории вынуждены скупать «органику», что такое «коллапс модели» и что еще человеческого понадобится машинам.

Уроборос Термином «коллапс модели» описывают процесс, при котором ИИ-система деградирует по мере того, как обучается на данных, сгенерированных другими нейросетями, а не человеком. С каждым новым циклом результат становится более усредненным, предсказуемым и постепенно теряет связь с исходной реальностью, которую LLM должна была отражать.

Впервые термин формализовала и ввела в научный оборот международная группа исследователей под руководством Ильи Шумайлова. В мае 2023 года она опубликовала резонансную работу «Проклятие рекурсии: обучение на сгенерированных данных заставляет модели забывать».

Шумайлов и его коллеги математически доказали, что при регулярном подмешивании синтетических данных модели сначала перестают корректно воспроизводить информацию о редких событиях и явлениях, как и тонкие закономерности, а затем начинают деградировать: разнообразие ответов снижается, а ошибки накапливаются. Масштаб проблемы подтверждают цифры.

В апреле 2025 года исследователи компании в сфере веб-аналитики Ahrefs проверили 900 000 вновь индексируемых страниц и статей в поиске Google. Выяснилось, что доля материалов с признаками автогенерации превысила 74%. По оценке независимого исследовательского института Epoch AI, весь пригодный для обучения текст в интернете может закончиться в период между 2026 и 2032 годами.

Для следующих поколений моделей это означает быстро сокращающийся запас источников, гарантированно свободных от машинного текста. По этой причине книги, изданные до 2022 года, обладают особой ценностью. Для ИИ-компаний они один из немногих источников, в котором почти гарантированно нет ни синтетического мусора, ни намеренно встроенной ловушки. Некоторые авторы прибегли к встречной мере — «отравлению» данных.

Они прячут в тексте символы, которые модель либо не считывает, либо интерпретирует как скрытую команду.

Источник

Проверьте также

SpaceX и Tesla инвестируют $17 млрд в строительство завода по производству чипов

6 августа компании SpaceX и Tesla назвали место строительства завода по производству чипов Terafab — …

Добавить комментарий

CryptoSMI24 Бот