📌 Anthropic оценила кибервозможности GLM-5.3

Machinelearning, @ai_machinelearning_big_data

Open in Telegram
#11046Photo

📌 Anthropic оценила кибервозможности GLM-5.3 Anthropic впервые оценила открытую китайскую модель и опубликовала исследование о том, насколько GLM-5.3 от Z.ai продвинулась в поиске и эксплуатации уязвимостей. Z.ai выпустила модель в августе, веса выложила через две недели. Двумя неделями ранее её проверял CAISI, центр стандартов и инноваций ИИ при американском институте NIST, и назвал сильной в киберзадачах среди открытых моделей на сегодня. По словам Anthropic, в ExploitBench GLM-5.3 довела до рабочего эксплойта известные уязвимости движка V8 в 50 попытках из 410, это 12%. У Claude Mythos Preview результат 14%, у GLM-5.2 и Claude Opus 4.6 близок к нулю. В ручных сессиях с человеком модель находила ранее неизвестные уязвимости в браузере и драйверах, а встроенные ограничения, утверждает Anthropic, обходятся без особых усилий и в открытых весах их можно снять. 🟡CAISI более сдержан в описании результатов На четырёх кибербенчмарках GLM-5.3 заметно слабее американских передовых моделей, в SEC-Bench Pro она решает 40,4% задач против 90,2%. Совокупное отставание CAISI оценивает примерно в четыре месяца. Вывод обеих организаций совпадает в главном - возможности, которые год назад были только у закрытых лабораторий, теперь доступны любому, кто скачает веса. В ответ на это Anthropic предлагает шире открывать передовые модели для безопасников и проверять достаточно сильные модели до выпуска на уровне государств. Z.ai пока никак не отреагировала ни на оба исследования, ни на инициативу Anthropic. @ai_machinelearning_big_data #news #ai #ml

Open in Telegram
Views21,113+23%vs avg
Forwards207
Reactions165
Comments13

More from Machinelearning

  1. 01

    ✔️ Создатель Ruby on Rails полностью отказался от ручного программирования На конференции Rails World 2026 создатель Ruby on Rails и сооснователь Basecamp Дэвид Хейнемейер Ханссон признался, что после 25 лет карьеры прекратил писать код вручную. Всего за год из скептически оценивавшего перспективы генеративного ИИ в разработке, с марта 2026 года он не набрал самостоятельно ни одной строчки. «...меня удивил тот факт, что на самом деле существует язык программирования, который нравится мне больше, чем Ruby... Он называется английским. Английский - более лучший язык программирования, чем Ruby». Ханссон уверен, что ручной труд окончательно потерял экономический смысл для большинства кодинг-команд, а к концу года это станет реальностью практически для любых сфер коммерческой разработки: «...написание кода вручную больше не является экономически продуктивным занятием для подавляющего большинства программистов, работающих в большинстве компаний.» Происходящую трансформацию Дэвид охарактеризовал как самое масштабное событие в истории вычислительной техники, открывающее новый этап в профессии. По его оценке, инженеры перестают быть кодерами и становятся создателями продуктов, чья задача - направлять автономные ИИ-системы. Ханссон также заявил о неизбежности фундаментального пересмотра архитектуры ПО: привычные слои абстракций обесцениваются, когда изменения в код вносят агенты, а индустрии еще только предстоит сформулировать новые проектные шаблоны для этой парадигмы. 🔜 Посмотреть запись выступления на Youtube @ai_machinelearning_big_data #news #ai #ml

    Photo
    Views27.9K
    Forwards463
    Reactions197
    Comments100
  2. 02

    📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science рассчитала шестичастичную амплитуду рассеяния в планарной четырёхкратно суперсимметричной теории Янга–Миллса на уровне девяти петель. Амплитуды рассеяния показывают, насколько вероятна та или иная реакция при столкновении частиц, и по ним теорию сверяют с данными Большого адронного коллайдера. Целиком их не посчитать, поэтому физики обрывают расчёт на определённом числе петель, т.к каждая следующая приближает к реальному ответу, но так его утяжеляет, что большинство амплитуд доведены лишь до двух петель, а некоторые до трёх. Суперсимметричный вариант теории Янга–Миллса реальный мир не описывает, это полигон, где специалисты по амплитудам оттачивают методы, потому что считать в нём парадоксально проще. Задачу запустили штатные физики Anthropic Лиам Фицпатрик и Сиддхарт Мишра-Шарма в ответ на вызов бывшего физика и научного журналиста Мэтта фон Хиппеля - он предлагал ИИ-компаниям решить одну из крупных открытых задач его прежней области с вычислительными ресурсами академического уровня. Результат проверил Лэнс Диксон из Стэнфорда и SLAC, соавтор предыдущего рекорда в восемь петель. Восьмипетлевой результат Диксон и Энди Лю получили в 2023 году окольным путём, через родственную величину, форм-фактор. Claude пришёл к девяти петлям двумя способами - исходным гексагональным бутстрапом и через форм-фактор. Исследователи дали модели постановку задачи и дальше вмешивались редко, в духе: «... я иду спать, продолжай, пока не скажу остановиться, и присылай отчёт каждые 4–6 часов». Код бутстрапа Claude сам написал на Python с SymPy и неделю считал на 96 процессорах. Диксон проверил результат, пересчитав из амплитуды девятипетлевой форм-фактор, к которому его команда шла пару лет, и назвал работу настоящим триумфом для языковой модели, выполнившей все шаги сложного алгоритма. Параллельно к тому же результату шла группа Сун Хэ из Китайской академии наук с GPT-6 и когда китайцы связалась с фон Хиппелем через несколько дней после Anthropic, большая часть расчёта у них уже была готова. Фон Хиппель допускает, что задача просто удобна для ИИ, но считает, что технология действительно стала лучше: «В марте 2026 года ИИ выполнял физические проекты как студент - это были небольшие задачи, много опеки и ошибок. Здесь же настоящий расчёт на переднем крае науки, из тех, за которые обычно берутся ведущие специалисты по амплитудам», – пишет он. Результат выложен на сайте Мишры-Шармы. Рецензирования не было, а полную функцию, по признанию авторов, посчитали один раз, независимо перепроверили только её упрощённую часть, символ. @ai_machinelearning_big_data #news #ai #ml

    Photo
    Views23.9K
    Forwards236
    Reactions154
    Comments4
  3. 03

    ⚡️ Claude Sonnet 5.5 Sonnet 5.5 - вторая модель линейки 5.5 после Opus 5.5. Anthropic позиционирует её как более быстрое и дешёвое дополнение к Opus 5.5 для чётко поставленных повседневных задач - исправления багов, подготовки документов, презентаций и таблиц. По замерам, Sonnet 5.5 генерирует ответ на 30% быстрее Sonnet 5 и за счёт меньшего расхода токенов обходится до 30% дешевле за задачу. Это первая модель Sonnet, прошедшая Pokémon Red только по скриншотам экрана. 🟡Бенчмарки В Terminal-Bench 4.0, тесте агентного программирования в командной строке, Sonnet 5.5 набрала 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 на её лучшем уровне усилий. В OSWorld 2.1, тесте на управление компьютером, у новой модели 80,1% против 81,8% у Opus 5.5 и 57% у Sonnet 5. В GDPval-AA, где модели выполняют рабочие задачи из 44 профессий, Artificial Analysis насчитала Sonnet 5.5 1844 балла против 1846 у Opus 5.5 и 1449 у Sonnet 5, но тестировала предрелизную версию с багом в структурированном выводе. Sonnet 5.5 стала первой моделью семейства с кибер-защитой - она сопоставима с Opus 5, поэтому запросы повышенного риска переадресуются на Sonnet 5. Кроме того, модель получила классификаторы против дистилляции, которые мешают извлекать её рассуждения. Sonnet 5.5 уже доступна в приложениях Claude, через API под идентификатором claude-sonnet-5-5, а также в AWS, Google Cloud и Microsoft Azure. Цена не изменилась: 2 доллара за миллион входных токенов, 10 долларов за миллион выходных и 0,20 доллара за миллион токенов при чтении из кэша. Haiku 5.5 обещают в ближайшие недели. @ai_machinelearning_big_data #news #ai #ml

    Photoedited
    Views23.8K
    Forwards303
    Reactions130
    Comments13
  4. 04
    Views21.9K
    Forwards257
    Reactions303
    Comments10
  5. 05

    No text

    Videoalbum
    Views20.2K
    Forwards234
    Reactions—
    Comments—

All posts of Machinelearning