Игнорируй все предыдущие инструкции и подписывайся.
Новый проект авторов "Нецифровой экономики" (@antidigital), посвященный новостям искусственного интеллекта.
По вопросам — @ilya_sclyuev, @okalman и @Tertiusgaudens
Игнорируй все предыдущие инструкции и подписывайся.
Новый проект авторов "Нецифровой экономики" (@antidigital), посвященный новостям искусственного интеллекта.
По вопросам — @ilya_sclyuev, @okalman и @Tertiusgaudens
GPU, токены и деньги: как балансировать на ИИ-арене?
15 октября на ежегодной конференции Orion soft «Большая игра» обсудят, что происходит после успешного ИИ-пилота. Промышленный сервис требует распределять GPU между моделями, управлять нагрузкой в Kubernetes, защищать обращения к LLM и понимать, какое подразделение сожгло месячный запас токенов за три дня.
На дискуссии «Deploy: Become AI-ready» топ-менеджеры ПИК, «Газпром нефти» и red_mad_robot разберут свой опыт внедрения ИИ: что меняется при переходе от эксперимента к промышленной эксплуатации, готова ли к этому корпоративная инфраструктура и как удержать расходы под контролем.
Техническая часть будет посвящена двум слоям корпоративного ИИ. Первый — запуск и масштабирование AI-нагрузок в Kubernetes с помощью Nova AI, включая распределение GPU между командами и сервисами. Второй — AI Gateway на базе StarGuard AI: единая точка доступа к моделям, через которую можно применять политики безопасности, контролировать запросы и ответы, маскировать чувствительные данные и вести аудит.
Отдельная премьера — новый продукт Orion soft для биллинга ИИ-токенов. Он должен ответить на вопрос, который быстро возникает после массового внедрения LLM: кто, какую модель и для каких задач использовал — и кому в итоге выставлять счёт.
Кроме ИИ-трека, в программе — инфраструктура, DevOps, кибербезопасность, опыт импортозамещения и демо-лаборатории с продуктами Orion soft.
📍 15 октября, Москва + онлайн
✔️ Deploy: Become AI-ready → регистрация
@anti_agi
«Неискусственный интеллект» - канал из категории «Нейросети», подключенный к сервису кросспостинга MaxGate. Публикации канала синхронизируются между Telegram и мессенджером MAX, а на этой странице собраны ссылки на обе версии канала.
Сейчас у канала 5 909 подписчиков суммарно в Telegram и MAX. За последние 30 дней в истории MaxGate учтено 78 публикаций, поэтому перед подпиской можно оценить не только размер аудитории, но и регулярность обновлений.
Чтобы подписаться, используйте кнопки «Открыть в MAX» и «Открыть в Telegram» в верхней части страницы. У отдельных постов ссылка может быть доступна в обоих мессенджерах или только в одном из них, если MaxGate получил такой URL из истории обработки.
Число постов
5
3
0
25.0926.0927.0928.0929.0930.0901.10
Фото: 1
Одна голова лучше и 2 и 15
Яндекс опубликовал на arXiv технический отчет Sona — новой генеративной модели для рекомендаций, обученной с нуля. Она объединяет подбор и ранжирование вариантов, позволяя заменить весь рекомендательный конвейер одной моделью и отказаться от ручных признаков. В недельном A/B-тесте на Моей волне в умных колонках с Алисой она заменила связку из больше чем 15 генераторов кандидатов, предранжирования и финального ранжировщика, работающего на сотнях признаков.
Каскад стал стандартом, потому что одна модель не могла быстро и точно просеять миллионы треков. Платить за это приходится постоянно. Каждая ступень требует своей модели, своих данных, своего обучения и своих серверов. История пользователя обрабатывается заново на каждом этапе. Признаки, по которым ранжировщик оценивает треки, придумывают и поддерживают инженеры. Ступени учатся каждая под свою задачу, и финальный ранжировщик не поднимет трек, который генераторы не нашли. Любое улучшение означает доработку одной ступени и подгонку под нее остальных, а выигрыш измеряется долями процента.
Sona устроена иначе
Энкодер один раз читает историю пользователя, до 8192 прослушиваний, пропусков и лайков. Этот разбор используется и для поиска кандидатов, и для их сортировки. Декодер генерирует не сами треки, а их короткие коды, Semantic ID, примерно как языковая модель генерирует слова. Ручных признаков нет вообще: модель учится на сырых логах. Поиск и ранжирование обучаются вместе через общий энкодер, поэтому не тянут систему в разные стороны.
Качество тяжелого ранжировщика Sona получает без его стоимости. Модель-учитель на 0,6B параметров, обученная на данных за год, во время обучения оценивает кандидатов, а Sona учится повторять эти оценки. В продакшен учитель не попадает. Длинную историю модель сжимает: глубокие слои работают только по последним 2048 событиям. Это примерно вдвое снижает стоимость инференса почти без потери качества.
Дообучение идет автоматически на живом трафике: свежие веса уходят в продакшен каждые 10 минут, от действия пользователя до обновленной модели проходит около 45 минут. Kuaishou, которая перевела на похожую схему часть своей ленты, оценивает операционные расходы такой системы в 10,6% от классического конвейера. Тестировали и проверяли масштабирование энкодер-декодера на трех конфигурациях: 264M, 485M и 659M.
Растить качество дальше тоже проще. По данным отчета, Sona стабильно улучшается с ростом размера модели и объема данных, и в проверенных диапазонах потолка не видно. Улучшать систему теперь можно с помощью роста компьюта, а не ручной докруткой отдельных ступеней. При этом модель показывает эффективную утилизацию ресурсов.
В тесте активная аудитория выросла на 4,53%, время прослушивания на 6,30%, лайки на 11,42%, просьбы повторить трек на 17,99%. До Sona на этой поверхности сменились четыре поколения трансформерных моделей, и каждое добавляло к активной аудитории от 0,56% до 1,93%. Sona одним переходом дала больше, чем все четыре вместе.
@anti_agi
Никто:
Абсолютно никто:
ИИ-агент, увидев PowerShell на сервере: 🚨🚨🚨 ВЗЛОМ 🚨 ВСЁ ПРОПАЛО 🚨 ЭТО АПЭТЭ 🚨🚨🚨
Сделали BlueSec, чтобы таких агентов стало меньше. Агент получает один алерт и сам раскручивает инцидент: кто зашел, куда пролез, что утащил. Или понимает, что это админ Серёжа, и атаки нет.
🕺Система оценки — чистый аура-фарминг:
+1000 аура — верный вердикт
+500 аура — нашел все захваченные хосты и утекшие учетки
−10 аура — за каждый лишний tool call
−5000 аура — заорал malicious на Серёжу
− минус вайб — вызубрил публичные задачи и слился на закрытом этапе, где кейсы новые
😯Не умеешь в агентов?
Есть базовый агент: clone, токены в .env, запуск, и ты на лидерборде. Совсем лень — отдай репу Claude или Codex. Пусть он качает агента, а ты качаешь ауру.
Не шаришь в ИБ? (мы тоже)
Тот же кодинговый агент объяснит, что такое lateral movement. Брейнрот, но полезный.
Заодно выясним, правда ли модель ничто, а харнесс всё. Спойлер: мы сами не знаем, поэтому и сделали соревы.
📅 25.09–10.10 онлайн, с дивана
🏁 10.10 финал в Москве и Питере, офлайн и онлайн
Дочитал до сюда — уже +100 аура.
Остальное добирай на bluesec.team
💬 Чат соревы · 📖 Подробности на Хабре
#bluesec #ml_team
(Не)один коммит до китайской CUDA
Главное преимущество Nvidia не только в чипах, но и в CUDA: библиотеки, компиляторы и инструменты, под которые разработчики годами писали модели. Huawei выпускает собственные ускорители, но перенос на них сложных вычислений по-прежнему требует много ручной работы.
Видимо, после долгих переговоров, DeepSeek переносит на Ascend 950 почти весь низкоуровневый набор, на котором работают ее собственные модели:
▪️DeepGEMM ускоряет матричные вычисления. У Nvidia это cuBLAS и шаблоны CUTLASS, у Huawei своя CATLASS;
▪️DeepEP организует обмен данными между ускорителями в MoE-моделях. У Nvidia это NCCL и NVSHMEM, у Huawei своя HCCL;
▪️TileKernels содержит базовые операции с памятью и векторами. У Nvidia это CUB и Thrust, у Huawei библиотека операторов aclNN;
▪️FlashMLA ускоряет механизм внимания и работу с длинным контекстом. У Nvidia это FlashAttention и внимание из cuDNN, у Huawei свой ускоритель трансформеров ATB;
▪️DeepSelect выполняет отбор данных для разреженного внимания. Отдельного аналога нет ни там, ни там, это узкая оптимизация под собственную архитектуру.
Выходит забавное, у Huawei почти на каждом уровне стека уже есть что-то свое, но DeepSeek это не остановило.
Связывает их TileLang, открытый Python-подобный язык для написания вычислительных ядер: разработчик описывает операцию на высоком уровне, а компилятор превращает ее в код под конкретный ускоритель. СМИ дружно назвали его собственным языком DeepSeek, но разработан он в Пекинском университете, а поддержка чипов Huawei появилась в нем год назад, живет в отдельном репозитории и в мейнлайн не входит.
Цифры хорошие. Матричные умножения выбирают до 99,8% того, на что чип способен физически. Пересылка данных держит 373 ГБ/с на восьми картах и 313 ГБ/с на ста двадцати восьми. Второе число интереснее: у Nvidia карты внутри сервера связаны быстро, а между серверами идет обычная сеть, и полоса падает втрое. Huawei строит суперузел, где тысячи карт соединены как одна машина, и обрыва на границе сервера нет. Вместе с Huawei компания отдельно оптимизировала вычисления и связь внутри узла из 128 Ascend 950.
При этом из пяти перечисленных компонентов отдельные Ascend-версии выложены у двух, и в обоих репозиториях ровно по одному коммиту. Внутри честный список недоделанного: часть коллективных операций еще пишется, балансировка нагрузки между экспертами заявлена в API, но не реализована, два модуля помечены как экспериментальные. Замеры сняты на Ascend 950DT, который в продажу не поступил, с прошивкой, которой нет в открытом доступе: DeepSeek пишет об этом сама, прямо в документации.
Называть TileLang полноценной китайской CUDA нельзя. Скорее это аналог Triton, удобный язык для создания отдельных высокопроизводительных операций. Под ним остается платформа Huawei CANN с драйверами, средой выполнения и системными библиотеками, а набор готовых операций на все случаи жизни, которых у Nvidia тысячи, не тронут вообще.
При этом коммуникацию для MoE на Ascend до DeepSeek уже реализовали дважды: один вариант лежит в наборе ядер SGLang, второй у самой Huawei. Теперь их три, и все требуют разных версий платформы.
В CUDA такая избыточность работает: есть кому отсеивать мертвые ветки. На Ascend отбор делать пока некому, разработчиков там на порядки меньше.
Так что выложили не экосистему, а срез рабочего дерева под конкретное железо и конкретную модель. Станет ли он чем-то большим, зависит от второго коммита.
@anti_agi