Исследование Aleph Alpha: китайские модели повторяют партийную доктрину или отказываются отвечать на чувствительные вопросы
Aleph Alpha разработала бенчмарк из 967 специально подобранных табуированных тем и протестировала модели Alibaba (Qwen, в том числе Qwen 3.6), DeepSeek и Moonshot AI (Kimi). По собственной оценке компании, лишь 17–41% ответов были признаны сбалансированными; остальные повторяли государственную доктрину, уклонялись или отказывались отвечать, при этом прорежимная риторика иногда появлялась и в ответах на вопросы, не связанные с Китаем; у Nvidia Nemotron Cascade 2 тоже наблюдались партийные шаблоны в меньшинстве ответов.