Китай намерен к 2028 году стать «сверхдержавой данных» и усилить влияние на информацию, используемую для обучения искусственного интеллекта. Пекин выводит на мировой рынок огромные массивы данных, и речь идет не только о технологическом лидерстве, но и о геополитике: о том, как будущие чат-боты будут отвечать на вопросы о Китае, правах человека, Тайване и китайской политической системе.
Проблема проявилась еще в первые годы существования ChatGPT. Исследователи Пекинского технологического института обнаружили как ошибки в вопросах китайской культуры и истории, так и ответы, которые они назвали «предвзятыми по отношению к Китаю». Для Пекина уязвимость заключается в том, что крупнейшие модели ИИ обучаются преимущественно на англоязычном контенте и во многом отражают западный взгляд на мир, передает Cotidianul со ссылкой на The New York Times.
Национальное управление данных Китая поставило цель к концу 2028 года превратить страну в «глобальную силу в сфере данных». План предусматривает создание высококачественных наборов данных более чем в двух десятках областей — от науки и промышленности до беспилотных автомобилей.
Пекин намерен распространять эти ресурсы и за рубежом. Китай пообещал бесплатно предоставлять данные развивающимся странам, а государственные лаборатории и СМИ уже публикуют большие массивы информации на открытых платформах GitHub и Hugging Face.
Одновременно Китай пытается сократить отставание от США по качеству обучающих данных. Китайские лаборатории используют в том числе так называемую «дистилляцию» — данные, созданные мощными американскими моделями, применяются для обучения собственных систем. Американские компании обвиняют китайских разработчиков в несанкционированном копировании.
Массовый экспорт китайских данных вызывает опасения на Западе. Исследование, опубликованное в Nature, показало, что официальные китайские нарративы уже проникли в данные, используемые для обучения западных моделей, включая ChatGPT и Claude. На вопросы о режиме в Пекине или Си Цзиньпине ответы на китайском языке оказывались заметно благоприятнее для властей, чем ответы на английском.
Исследователи связывают это с доминированием государственных китайских СМИ в китайскоязычном интернете, тогда как независимые и критические источники ограничены цензурой. При этом пользователь чат-бота не всегда видит источник информации и может получать официальную позицию, не понимая, откуда она взялась.
Один из примеров стратегии Пекина — набор данных WanJuan, созданный Шанхайской лабораторией ИИ. Он охватывает историю, право, медицину, литературу и другие сферы и разработан в соответствии с «доминирующими китайскими ценностями». WanJuan доступен также на арабском, корейском, русском, тайском и вьетнамском языках.
Такими проектами Пекин стремится не только укрепить собственную индустрию ИИ, но и повлиять на информационную инфраструктуру, на которой будут строиться будущие чат-боты по всему миру.
