Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #14689

Safe-Role Question-Answer (SRQA)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

SSRFT: Интернализация безопасной роли для устойчивого согласования безопасности LLM (arXiv:2610.07023v1)

В статье предложен метод SSRFT (Supervised Safe-Role Fine-Tuning), который обучает модели «интернализировать» заранее определённую безопасную роль через создание набора Safe-Role Q&A (SRQA) из психометрических вопросов, ограниченных джейлбрейк‑промптов и описания безопасной роли; ответы, согласованные с ролью, синтезируются, валидируются и расширяются в разные сценарии. Эксперименты на нескольких Base и Instruct моделях показывают, что SSRFT обеспечивает более устойчивое и обобщаемое согласование безопасности по сравнению со стандартным SFT: лучшая защита от prefilling‑атак, более хорошая генерализация на невидимые домены джейлбрейков, уменьшение избыточных отказов и сохранение общих способностей модели.

6.0