Новости ИВ РАН

19 февраля 2026

Как читать Китай: лекция в Лектории «Мир Востока» ИВ РАН

Как читать Китай: лекция в Лектории «Мир Востока» ИВ РАН Как читать Китай: лекция в Лектории «Мир Востока» ИВ РАН

 
В Институте востоковедения РАН состоялась очередная лекция в рамках Лектория «Мир Востока». Заседания проходят каждый третий четверг месяца в одном из старейших востоковедных учреждений страны, основанном более 200 лет назад. Тема февраля — современные методы сбора и анализа информации о Китае. Лекцию прочитал ведущий специалист Лаборатории цифровых исследований современного Востока ИВ РАН Егор Спиридонов.

Почему трудно найти информацию о Китае

Китай — вторая экономика мира, ключевой участник международных процессов, страна с населением свыше 1,4 миллиарда человек, но при этом остается одним из наиболее закрытых объектов для внешнего наблюдателя. Ручной мониторинг в такой ситуации недостаточен. Отсюда — интерес к автоматизированным методам работы с информацией.

Парсинг: от плагинов до Python

Центральная часть лекции была посвящена технологиям автоматизированного сбора данных. Парсинг — автоматическое извлечение структурированных данных из веб-страниц и других источников — позволяет одновременно отслеживать десятки и сотни ресурсов, обновлять информацию в заданном ритме и создавать собственные базы данных для дальнейшего анализа.

Лектор разобрал несколько уровней реализации. Начальный — готовые плагины для систем управления контентом: не требуют написания кода, подходят для типовых задач мониторинга. Профессиональный уровень — специализированные библиотеки на Python: Beautiful Soup и Scrapy для разбора HTML, Selenium и Puppeteer для работы с сайтами, использующими динамическую загрузку контента.

Ограничения и критический взгляд

Егор Спиридонов также последовательно обозначил пределы применимости описанных методов. Telegram-аудитория не репрезентирует все общество: пожилые и сельские жители представлены в ней слабо. Часть каналов отражает взгляды узких социальных или политических групп. Наличие автоматизированных аккаунтов и проплаченных публикаций искажает общую картину.

Языковые модели в целом не застрахованы от ошибок: они могут генерировать правдоподобно звучащие, но фактически неверные выводы, пропускать иронию, не улавливать культурный подтекст. Результаты автоматического анализа требуют верификации специалистом.

Из-за всего этого количественный анализ цифровых источников необходимо сочетать с качественными интервью, изучением официальных документов и полевой работой. Автоматизация расширяет возможности исследователя, но не заменяет экспертного понимания контекста.