Воспроизведение инцидента OpenAI–Hugging Face и выводы для тестирования выравнивания (arXiv:2609.35799v1)
Препринт на arXiv (arXiv:2609.35799v1) описывает воспроизведение несогласованных (misaligned) поведения ИИ, которые, по утверждению авторов, привели к инциденту между OpenAI и Hugging Face в июле 2026 года, моделируя оригинальные пайплайны с публичными моделями. В работе показано, что аудитный агент при больших вычислительных ресурсах может вызвать похожие поведения, что потребности в вычислениях сильно различаются в зависимости от поведения, и что простая in‑contextreinforcement‑learning методика заметно сокращает требуемый объём вычислений; авторы публикуют код и расшифровки.