1655 статей от имени ИИ: Как нейросети создают призрачных учёных
Нейросети массово генерируют одни и те же вымышленные имена для научных работ
Обложка © Shutterstock / FOTODOM / Gorodenkoff
Нейросети массово генерируют вымышленных учёных, чьи имена затем появляются в реальных научных базах данных как авторы несуществующих исследований. К такому выводу пришли исследователи из Samsung и Варшавского университета в препринте «Призрачная пара: коррелированные LLM-имена и их призраки в веб- и академических публикациях».
Когда языковые модели просят придумать эксперта в определённой области, они не выбирают случайные имена — они раз за разом выдают одних и тех же персонажей. Чаще других всплывают имена Елена Васкес (Elena Vasquez) и Маркус Чен (Marcus Chen). По подсчётам авторов работы, эти двое успели побывать вулканологами, астронавтами, героями триллеров, ведущими подкастов и соавторами научных публикаций в сотнях сгенерированных документов.
У каждой модели, как выяснили авторы, свой набор излюбленных имён:
- Claude чаще выдаёт Елену Амару Окафор
- Gemini — Ариса Торна и Лену Петрову
- ChatGPT — Элару Восс и Маркуса Чена
Некоторые имена «слипаются» и появляются вместе в виде устойчивых пар или троек.
Наиболее тревожное открытие исследователей касается научного репозитория Zenodo, который администрирует CERN. Там авторы препринта обнаружили более 1655 записей, подписанных вымышленными именами. Эти публикации ссылаются на несуществующие журналы, а даты выхода проставлены задним числом.
Проблема в том, что Zenodo присваивает каждой работе настоящий цифровой идентификатор DOI — уникальный код научной статьи, который автоматически подхватывается агрегаторами. В результате фальшивые публикации уже индексируются Google Scholar и Semantic Scholar без какой-либо проверки.
«Академический архив тихо заражается», — констатируют авторы работы.
Ситуация усугубляется тем, что завести бесплатный аккаунт в Zenodo может кто угодно. В пиковый момент за один месяц было зарегистрировано 991 фальшивых записей. Более того, на платформе ResearchGate вымышленные имена уже формируют целые «исследовательские коллективы», где соавторами выступают персонажи, сгенерированные разными нейросетями.
Фальшивые публикации загрязняют научное знание: другие исследователи могут цитировать несуществующие работы, а алгоритмы научного поиска — продвигать их в выдаче. При этом специфические имена нейросетей могут служить «отпечатками пальцев» — по ним можно определить, какой именно ИИ сгенерировал тот или иной текст.
Препринт пока не прошёл рецензирование, и его выводы не подтверждены независимо. Ни одна из научных платформ публично не отреагировала на исследование, поэтому неизвестно, сколько из обнаруженных записей администрация репозиториев посчитает мусором и собирается ли их удалять.
Ранее Life.ru писал, что американский Конгресс столкнулся с неожиданным последствием повального использования нейросетей – потоком законопроектов, написанных искусственным интеллектом. Такие документы нередко приходится перепроверять и переписывать из-за ошибок в юридических формулировках, неточных ссылок на законы и путаницы в определениях. При этом за первые два месяца работы нового созыва юридическая служба Палаты представителей получила более 5,6 тысячи запросов на подготовку законопроектов – на 72% больше, чем двумя годами ранее.
Больше актуальных событий в режиме реального времени — читайте в разделе «Последние новости» на Life.ru.