ИИ без цензуры как услуга: планка для атак стала ниже

Американский стартап продаёт доступ по API к открытым моделям, из которых удалены механизмы отказа. Разбираем, что это значит для малого бизнеса, и даём короткий чек-лист на этот месяц.

Раньше снятие защитных фильтров с открытой ИИ-модели было проектом для энтузиастов. Теперь это продукт, который можно купить по карте. Как сообщает The Decoder, американский стартап Abliteration.ai берёт открытые модели, вырезает из них обученные отказы и продаёт доступ через коммерческий API. Для малого бизнеса интересна не сама технология — а то, что стоимость и уровень навыков, нужные для создания убедительных мошеннических материалов, снова упали.

Что на самом деле изменилось

Техника называется «абляция» (abliteration). Вместо того чтобы обманывать модель хитрым промптом, процесс находит внутренние паттерны, из-за которых модель говорит «нет», и корректирует веса, чтобы подавить их. В результате модель гораздо реже отказывается выполнять чувствительные запросы, при этом, по собственным оценкам компании, способности к написанию кода и работе в качестве агента почти не страдают.

Изменённые модели годами циркулируют на публичных хабах. Новое здесь — упаковка. Abliteration.ai не публикует веса для скачивания. Компания хостит модель и продаёт доступ по пять долларов за миллион входных или выходных токенов, так что клиенту не нужны ни GPU, ни навыки машинного обучения. Заявленный рынок — работа в области наступательной безопасности: red teaming, анализ вредоносного ПО, воспроизведение известных уязвимостей, имитация фишинга. Компания утверждает, что первый спрос пришёл от фирм, тестирующих ИИ-агентов, развёрнутых крупными организациями и банками.

Оставшиеся ограничения тонки. TechCrunch сообщил, что без особого труда получил код для извлечения сохранённых паролей Chrome и подробное руководство по выращиванию опасного патогена. Некоторые лимиты сохраняются, включая запросы о самоповреждении и сексуальном контенте с участием детей. Промпты и ответы не сохраняются — это защищает добросовестные команды безопасности, но также означает, что нет логов, которые можно проверить в случае злоупотребления. Провайдер не требует стандартной идентификации или проверки документов, аргументируя это тем, что такие проверки всё равно не отделят надёжно добросовестных пользователей от недобросовестных и поставят в невыгодное положение небольшие фирмы по безопасности.

Стоит отметить: специалисты по безопасности не единодушны в том, что всё это вообще необходимо. Несколько поставщиков red-team-услуг сказали TechCrunch, что «абляционированные» модели не входят в их обычную работу, а один анализ показал, что немодифицированная предыдущая версия модели уже не отказывала ни в одном тесте на наступательную безопасность. Abliteration.ai также не одинока — другие провайдеры хостят похожие неограниченные модели. История здесь не в одной компании, а в тренде.

Почему это важно для малого бизнеса

Никто не покупает модель без цензуры, чтобы специально нацелиться на компанию из десяти человек. Риск косвенный и дешёвый: лучше написанные фишинговые письма, более правдоподобные счета, более чистый локализованный текст на любом языке ваших клиентов, и сценарии атак, создаваемые быстрее людьми с ограниченными навыками. Старые защиты, полагавшиеся на распознавание плохой грамматики или криво оформленного документа, больше не работают.

Второе следствие — ваши собственные системы, работающие с ИИ, становятся частью поверхности атаки. Если у вас есть чат-бот, который может искать заказы, менять адреса или оформлять возвраты, рано или поздно кто-то проверит, можно ли уговорить его сделать то, чего он делать не должен. Люди, тестирующие агентов в банках, делают именно это — намеренно.

Что с этим делать

  • Пропишите правило подтверждения платежей и зафиксируйте его письменно. Любое изменение банковских реквизитов, любой новый аккаунт поставщика, любой необычный перевод проверяется вторым человеком по каналу, который не доставлял исходный запрос. По номеру телефона, который у вас уже был, а не из письма.
  • Перестаньте считать тон и внешний вид доказательством личности. Голос в звонке, знакомое лицо на видео, подпись в подвале письма — ничто из этого не подтверждает, с кем вы на самом деле общаетесь. Договоритесь о процедуре обратного звонка или общей кодовой фразе для важных запросов и разрешите сотрудникам пользоваться ею, не считая это невежливым.
  • Дайте команде разрешение не спешить. Обучайте людей текущей реальности: мошеннические сообщения теперь хорошо написаны, грамматически верны на вашем языке и часто ссылаются на реальные детали. Сигнал, на который стоит обращать внимание — срочность плюс просьба о деньгах, учётных данных или доступе.
  • Проверьте, что разрешено делать вашим ботам и ИИ-агентам. Где возможно — только чтение. Возвраты, скидки, изменения адресов и выгрузку данных держите под ручным утверждением, с логом того, кто что одобрил.
  • Включите логирование и многофакторную аутентификацию там, где их ещё нет. Если что-то пойдёт не так, разница между плохим днём и плохим кварталом будет в том, видите ли вы, что произошло.

Направление здесь скорее устойчивое, чем драматичное. Возможности, которые раньше было неудобно получить, становятся услугами, а услуги дешевеют. Вы не можете контролировать эту сторону уравнения, поэтому полезная работа — на вашей стороне: меньше решений, принимаемых одним человеком, меньше действий, которые автоматическая система может выполнить без присмотра, и команда, которой прямо сказали: хорошо написанное сообщение — не значит заслуживающее доверия.

ИсточникНаписано по материалу The Decoder. Оригинал: Stripping safety guardrails from open-weight AI models is now a turnkey commercial service

Ещё статьиВсе статьи

Сколько стоит сайт для малого бизнеса?

У сайта два ценника: разовая разработка и ежемесячные расходы на его поддержку. Разбираем, что входит в каждый из них, когда достаточно конструктора, а когда собственный код окупается по-настоящему.

Читать

Украденные сессии Claude показывают риски AI-подписок

Консультант заметил, что расход токенов Claude растёт, хотя он не работал. Anthropic позже объяснила это скомпрометированным ключом сессии и инфостилером. Рассказываем, как защитить AI-аккаунты компании.

Читать

Сколько стоит сайт под ключ в 2026 году: разбор цен

Сайт под ключ может стоить от лендинга на одну страницу до полноценного интернет-магазина. Рассказываем, что влияет на цену, что входит в каждый тип проекта и когда достаточно конструктора.

Читать