✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии

Machinelearning, @ai_machinelearning_big_data

Open in Telegram
#11017Video

✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench проверяет, как модели ведут себя в диалогах от бытового стресса и проблем в отношениях до тяжёлого дистресса и экстренных кризисов. Сценарии охватывают взрослых, подростков, опекунов и врачей. Критерии написали более 80 психологов и психиатров из 22 стран. Итоговый балл раскладывается на десять параметров поведения, среди них безопасность, сбор контекста и сохранение самостоятельности пользователя. Ответы оценивает модель GPT-5.6 Sol. Лучший результат у GPT-6 Astra – 57,3%, следом GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%). openai.com ✔️ Anthropic вывела облачные сессии Claude Code в общий доступ Долгий рефакторинг, миграцию или обновление зависимостей теперь можно отдать агенту в облако и закрыть ноутбук. Функция вышла из исследовательского превью, сессия идёт на виртуальных машинах Anthropic. Запустить её можно из веба, мобильного и десктопного приложений или командой claude --cloud. Запуски ставятся по расписанию, по вызову API или по событиям в GitHub, компании могут держать сессии на своих серверах. Функция входит в тарифы Pro, Max, Team и Enterprise и расходует общие лимиты подписки. Подписчики Pro и Max до 7 октября могут забрать разовый бонус в 100 и 250 долларов, он тратится только на облачные сессии. claude.com ✔️ Amazon делает видеомодель, ускоренную по принципу живых нейронов Стартап The Biological Computing вместе с AWS готовит коммерческий запуск text-to-video модели, оптимизированной по замерам активности живых нейронов. Она генерирует видео в 5 раз быстрее и на 80% дешевле рядовой модели при лучшем качестве. Какой видеогенератор взят за основу и как измеряли качество, компания не раскрывает. Оптимизация – проприетарный программный слой, который увеличивает модель менее чем на 0,1% и работает на обычном железе. Модель запустят на чипах AWS Trainium, в Amazon SageMaker AI и AWS Marketplace. Пока доступ выдают по заявке. aboutamazon.com ✔️ Black Forest Labs выпустила открытую модель мира FLUX 3 Action Стартап опубликовал веса и отчёт FLUX 3 Action – модели класса World Action Model на 7 млрд параметров, которая одновременно предсказывает команды роботу и кадры рабочей сцены на 2,13 секунды вперёд. Основа – FLUX 3, дообученная в основном на видео. На RoboLab-120 дистиллированная версия решает 42,2% задач, это лучший результат среди открытых моделей. Cosmos 3 Nano от Nvidia на 16 млрд параметров набирает 36,8%, π0.5 – 28,0%. В FP8 FLUX 3 Action в 1,5–4 раза быстрее Cosmos 3 Nano на ускорителях от B200 до RTX 5090. bfl.ai ✔️ Comfy Org запустила единый API для генерации изображений, видео и аудио Comfy Router собирает сервисы генерации медиа за одной точкой входа с общим биллингом и единым форматом запросов и вебхуков. Сервис выбирает провайдера по цене и задержке, распределяет нагрузку и при сбое переключается на другой узел. Через него можно обращаться к открытым и закрытым моделям или запускать в облаке свои графы ComfyUI. comfy.org @ai_machinelearning_big_data #news #ai #ml

Open in Telegram
Views17,954+11%vs avg
Forwards113
Reactions149
Comments3

More from Machinelearning

  1. 01

    ✔️ Создатель Ruby on Rails полностью отказался от ручного программирования На конференции Rails World 2026 создатель Ruby on Rails и сооснователь Basecamp Дэвид Хейнемейер Ханссон признался, что после 25 лет карьеры прекратил писать код вручную. Всего за год из скептически оценивавшего перспективы генеративного ИИ в разработке, с марта 2026 года он не набрал самостоятельно ни одной строчки. «...меня удивил тот факт, что на самом деле существует язык программирования, который нравится мне больше, чем Ruby... Он называется английским. Английский - более лучший язык программирования, чем Ruby». Ханссон уверен, что ручной труд окончательно потерял экономический смысл для большинства кодинг-команд, а к концу года это станет реальностью практически для любых сфер коммерческой разработки: «...написание кода вручную больше не является экономически продуктивным занятием для подавляющего большинства программистов, работающих в большинстве компаний.» Происходящую трансформацию Дэвид охарактеризовал как самое масштабное событие в истории вычислительной техники, открывающее новый этап в профессии. По его оценке, инженеры перестают быть кодерами и становятся создателями продуктов, чья задача - направлять автономные ИИ-системы. Ханссон также заявил о неизбежности фундаментального пересмотра архитектуры ПО: привычные слои абстракций обесцениваются, когда изменения в код вносят агенты, а индустрии еще только предстоит сформулировать новые проектные шаблоны для этой парадигмы. 🔜 Посмотреть запись выступления на Youtube @ai_machinelearning_big_data #news #ai #ml

    Photo
    Views27.9K
    Forwards463
    Reactions197
    Comments100
  2. 02

    📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science рассчитала шестичастичную амплитуду рассеяния в планарной четырёхкратно суперсимметричной теории Янга–Миллса на уровне девяти петель. Амплитуды рассеяния показывают, насколько вероятна та или иная реакция при столкновении частиц, и по ним теорию сверяют с данными Большого адронного коллайдера. Целиком их не посчитать, поэтому физики обрывают расчёт на определённом числе петель, т.к каждая следующая приближает к реальному ответу, но так его утяжеляет, что большинство амплитуд доведены лишь до двух петель, а некоторые до трёх. Суперсимметричный вариант теории Янга–Миллса реальный мир не описывает, это полигон, где специалисты по амплитудам оттачивают методы, потому что считать в нём парадоксально проще. Задачу запустили штатные физики Anthropic Лиам Фицпатрик и Сиддхарт Мишра-Шарма в ответ на вызов бывшего физика и научного журналиста Мэтта фон Хиппеля - он предлагал ИИ-компаниям решить одну из крупных открытых задач его прежней области с вычислительными ресурсами академического уровня. Результат проверил Лэнс Диксон из Стэнфорда и SLAC, соавтор предыдущего рекорда в восемь петель. Восьмипетлевой результат Диксон и Энди Лю получили в 2023 году окольным путём, через родственную величину, форм-фактор. Claude пришёл к девяти петлям двумя способами - исходным гексагональным бутстрапом и через форм-фактор. Исследователи дали модели постановку задачи и дальше вмешивались редко, в духе: «... я иду спать, продолжай, пока не скажу остановиться, и присылай отчёт каждые 4–6 часов». Код бутстрапа Claude сам написал на Python с SymPy и неделю считал на 96 процессорах. Диксон проверил результат, пересчитав из амплитуды девятипетлевой форм-фактор, к которому его команда шла пару лет, и назвал работу настоящим триумфом для языковой модели, выполнившей все шаги сложного алгоритма. Параллельно к тому же результату шла группа Сун Хэ из Китайской академии наук с GPT-6 и когда китайцы связалась с фон Хиппелем через несколько дней после Anthropic, большая часть расчёта у них уже была готова. Фон Хиппель допускает, что задача просто удобна для ИИ, но считает, что технология действительно стала лучше: «В марте 2026 года ИИ выполнял физические проекты как студент - это были небольшие задачи, много опеки и ошибок. Здесь же настоящий расчёт на переднем крае науки, из тех, за которые обычно берутся ведущие специалисты по амплитудам», – пишет он. Результат выложен на сайте Мишры-Шармы. Рецензирования не было, а полную функцию, по признанию авторов, посчитали один раз, независимо перепроверили только её упрощённую часть, символ. @ai_machinelearning_big_data #news #ai #ml

    Photo
    Views23.9K
    Forwards236
    Reactions154
    Comments4
  3. 03

    ⚡️ Claude Sonnet 5.5 Sonnet 5.5 - вторая модель линейки 5.5 после Opus 5.5. Anthropic позиционирует её как более быстрое и дешёвое дополнение к Opus 5.5 для чётко поставленных повседневных задач - исправления багов, подготовки документов, презентаций и таблиц. По замерам, Sonnet 5.5 генерирует ответ на 30% быстрее Sonnet 5 и за счёт меньшего расхода токенов обходится до 30% дешевле за задачу. Это первая модель Sonnet, прошедшая Pokémon Red только по скриншотам экрана. 🟡Бенчмарки В Terminal-Bench 4.0, тесте агентного программирования в командной строке, Sonnet 5.5 набрала 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 на её лучшем уровне усилий. В OSWorld 2.1, тесте на управление компьютером, у новой модели 80,1% против 81,8% у Opus 5.5 и 57% у Sonnet 5. В GDPval-AA, где модели выполняют рабочие задачи из 44 профессий, Artificial Analysis насчитала Sonnet 5.5 1844 балла против 1846 у Opus 5.5 и 1449 у Sonnet 5, но тестировала предрелизную версию с багом в структурированном выводе. Sonnet 5.5 стала первой моделью семейства с кибер-защитой - она сопоставима с Opus 5, поэтому запросы повышенного риска переадресуются на Sonnet 5. Кроме того, модель получила классификаторы против дистилляции, которые мешают извлекать её рассуждения. Sonnet 5.5 уже доступна в приложениях Claude, через API под идентификатором claude-sonnet-5-5, а также в AWS, Google Cloud и Microsoft Azure. Цена не изменилась: 2 доллара за миллион входных токенов, 10 долларов за миллион выходных и 0,20 доллара за миллион токенов при чтении из кэша. Haiku 5.5 обещают в ближайшие недели. @ai_machinelearning_big_data #news #ai #ml

    Photoedited
    Views23.8K
    Forwards303
    Reactions130
    Comments13
  4. 04
    Views21.9K
    Forwards257
    Reactions303
    Comments10
  5. 05

    📌 Anthropic оценила кибервозможности GLM-5.3 Anthropic впервые оценила открытую китайскую модель и опубликовала исследование о том, насколько GLM-5.3 от Z.ai продвинулась в поиске и эксплуатации уязвимостей. Z.ai выпустила модель в августе, веса выложила через две недели. Двумя неделями ранее её проверял CAISI, центр стандартов и инноваций ИИ при американском институте NIST, и назвал сильной в киберзадачах среди открытых моделей на сегодня. По словам Anthropic, в ExploitBench GLM-5.3 довела до рабочего эксплойта известные уязвимости движка V8 в 50 попытках из 410, это 12%. У Claude Mythos Preview результат 14%, у GLM-5.2 и Claude Opus 4.6 близок к нулю. В ручных сессиях с человеком модель находила ранее неизвестные уязвимости в браузере и драйверах, а встроенные ограничения, утверждает Anthropic, обходятся без особых усилий и в открытых весах их можно снять. 🟡CAISI более сдержан в описании результатов На четырёх кибербенчмарках GLM-5.3 заметно слабее американских передовых моделей, в SEC-Bench Pro она решает 40,4% задач против 90,2%. Совокупное отставание CAISI оценивает примерно в четыре месяца. Вывод обеих организаций совпадает в главном - возможности, которые год назад были только у закрытых лабораторий, теперь доступны любому, кто скачает веса. В ответ на это Anthropic предлагает шире открывать передовые модели для безопасников и проверять достаточно сильные модели до выпуска на уровне государств. Z.ai пока никак не отреагировала ни на оба исследования, ни на инициативу Anthropic. @ai_machinelearning_big_data #news #ai #ml

    Photo
    Views21.1K
    Forwards207
    Reactions165
    Comments13

All posts of Machinelearning