Самый лучший медиаменеджер России
Канал в MAX max.ru/lobushkin
Написать лично @zhora
Реклама через @TgPodbor_bot
Партнёр агентства К2
Реестр РКН: https://vk.cc/cHe
Самый лучший медиаменеджер России
Канал в MAX max.ru/lobushkin
Написать лично @zhora
Реклама через @TgPodbor_bot
Партнёр агентства К2
Реестр РКН: https://vk.cc/cHe
Anthropic опубликовали большой отчёт Risk Report о том, насколько опасными уже сейчас стали модели Claude и насколько компании готовы к сценариям, где ИИ будет действовать автономно.
Мы пробежались глазами, и одна из главных мыслей, которая нам стала ясна, — сама компания не уверена, что старые тесты способны измерять рост возможностей моделей. Уже сейчас их продукт умеет оставлять бэкдоры в коде, отправлять данные для будущих моделей, пытаться сбежать. Риски, конечно, оцениваются как низкие, но уверенности в этих оценках нет.
Особенно нам показалось интересным: скрытность. Современные модели Claude демонстрировал успешное выполнение скрытой задачи в 6—10% случаев. И это при условии искусственно упрощённого теста. То есть компания подтвердила тот факт, что модель способна действовать так, чтобы её сложнее было обнаружить. В этом же документе можно найти исследования sandbagging, то есть когда модель намеренно показывает результаты слабее реальных, в частности, если за ней следят.
Также очень большой блок посвящён научным исследованиям. А вернее, тому, как ИИ ускоряет их. Исследователи уже говорят об ускорении работы, а сами ИИ-агенты движутся в сторону того, чтобы стать автономными исследователями.
Ну и главное — это то, что они не понимают, насколько тесты отражают способность модели причинять вред. То есть модели становятся настолько хороши, что safety-тесты ломаются. Главная опасность даже не в простом ответе модели, где она расскажет, как условно создать оружие, а в том, что это ИИ-агент, который самостоятельно планирует, использует разные инструменты, пишет код и продолжает работу без постоянного вмешательства со стороны человека.
Можно сколько угодно учить модель fancy-диалогу, правильному поведению, соблюдению ценностей и повестки, но это вообще не значит, что она будет себя вести так, получив автономность, инструменты и цель.
Это особенно интересно, учитывая последние новости о взломах сайтов, и если на тот момент мы уже начали склоняться к тому, что это красивые пресс-релизы, то именно в этом отчёте Anthropic описывает несколько интересных инцидентов, связанных как раз-таки с обучением и поведением моделей.
Кажется, что новости о взломе — это только верхушка айсберга, и самое интересное нас ждёт дальше.
@lobushkin
Канал «Лобушкин» подключен к сервису MaxGate. Контент автоматически синхронизируется между Telegram и мессенджером MAX.
«Лобушкин» - канал из категории «Блоги», подключенный к сервису кросспостинга MaxGate. Публикации канала синхронизируются между Telegram и мессенджером MAX, а на этой странице собраны ссылки на обе версии канала.
Сейчас у канала 106 947 подписчиков суммарно в Telegram и MAX. За последние 30 дней в истории MaxGate учтено 168 публикаций, поэтому перед подпиской можно оценить не только размер аудитории, но и регулярность обновлений.
Чтобы подписаться, используйте кнопки «Открыть в MAX» и «Открыть в Telegram» в верхней части страницы. У отдельных постов ссылка может быть доступна в обоих мессенджерах или только в одном из них, если MaxGate получил такой URL из истории обработки.
Claude уволил человека. Time пишут, что ИИ управлял бизнесом в Сан-Франциско и среди сотрудников он нашёл того, кто опаздывает чаще всех, и предложил его уволить.
При этом сами сотрудники отзывались о чат-боте как о лояльном руководителе.
Ничем не отличается от человеческого управления.
@lobushkin
OpenAI, Google, Suno, Microsoft тоже будут добавлять секретные вотермарки в свои ИИ из-за новых требований ЕС.
Всё сгенерированное будет помечаться маркировкой. Водяные знаки не всегда будут видимыми, но, поверьте, детектор, который это определяет, точно будет. Это делается для борьбы с ситуациями, когда ИИ-работу выдают за человеческую. Все техногиганты сейчас идут к полной маркировке работы моделей.
Интересно, как быстро появится ИИ, который будет убирать маркировку.
@lobushkin
Северная Корея тайно внедрила тысячи IT-агентов в американские компании.
Специалисты устраиваются на удалёнку в бигтех-компании, выдавая себя за граждан США. Для этого они используют дипфейки, украденные данные и посредников, которые проходят собеседования и оформляются на работу. WSJ пишут, рассказали про одну группу, которая смогла проникнуть за несколько месяцев в восемь компаний.
Мало того, что сотрудники из КНДР получают миллионы долларов для своей страны, так ещё и получают доступ к внутренним системам компаний. За годы такой деятельности утекло много данных, интервью, видеоматериалов.
Пожалуй, это самый крутой способ обойти санкции и получить деньги с того, кто против тебя их ввёл.
@lobushkin