>>299474 (OP) Кто чем перерабатывает PDF документы ( в частности советские учебники) в markdown формат? ПК у меня нет, капчую с планшета андроид. Нужно ли сначала прогонять файл через OCR сканер и только потом в MD?
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
>>1670846 На 5070 ti 640х480 (читай 1280х960) ты уже за минуту увидишь, там 56-62 сек генерируется. Текнолоджи. Но хорошо, что тае выпустили, у кого видяшки послабее.
>>1670850 Без апскейла — да, но коротенькие и долго.
>>1670863 Мне нейронка хуярит эти тексты и збс получается в рефе.
>>1670898 Первая так себе, вроде норм, но лайтх2в топчик, но с весом 0.5 обязательно.
>>1670935 Две совершенно разные архитектуры. У ЛТХ всегда были realtime видео на 4090/5090. В этом их фишка. И контекст милипиздрический. Но качество такое себе. А тут раза в четыре дольше, ну, с апскейлом, раза в два дольше, и контекст толстенький, влезает меньше. Да и апскейл не латентный, а растровый. НО ТЫ ПОПРОБУЙ ЕГО СЛЕДОВАНИЕ ИНСТРУКЦИЯМ ТЫ ПОПРОБУЙ ЕГО РЕФЕРЕНС ТУ ВИДЕО АУДИО Не пихай видео, чтобы не работало долго, а чисто картинка + голос опционально, для скорости. Оно ебет мощнейше (хотя голос не идеально воис-клонит).
А цензуры и знание персонажей и знаменитостей? Пишешь кого хочешь — и оно с 50% знает кто это и рисует сам, так еще и озвучка близкими к оригиналу голосами.
>>1670992 6 степов: сажа по умолчанию, сол с 0.2 - 0.9, применяется для 3, 4, 5 шагов, пока все. Посмотрим седня, что за ферст блок кеш, а так тебе много не надо.
>>1670999 Эээ… У меня стабильно 1,5 сек на него тратится. И дено, и ориг. Я за 2,5 лишние секунды получаю х2 разрешение (мыльноватое правда, как х1.5 считай).
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1671033 Так на лоу жизни и нет. В среднем у людей 12-16 гб врам, то есть они даже не запустят квен 27б. И такие, по идее, могут запустить что-то жирнее, если оперативки много, но тот же 35б квен дерьмо, 26б гемма тоже дерьмо по сравнению с 31б. Да, пишет хорошо, но глубины 0.
Вменяемым вариантом в таком случае является квен 80б. Он пишет терпимо и глубины у него явно больше, внимание к контексту почти такое же как у 27б, но он требует 64 гб оперативки уже.
За пределами этого треда люди только апасные 9-12б модельки могут запускать. Раньше хоть какая-то жизнь на немо была, обсуждения, файнтюны, хайп, а щас все сидят либо на апи, либо покупают железо оверпрайс. Каждый тредовичок — это жировик с 24-48 врам и 128 рам.
Хотя технологии стали лучше. Уже можно было бы ту же 12б гемму катать отлично или затюнить моешку под разные задачи, но тюнов особо нет, они все дерьмо, да и еретики под них почти никто не делает.
>>1670749 Проблема не в ждунах а в том, что окно между "странная ненужная хуйня за копейки" и "ультрараскрывшаяся йоба для LLM" составляют, зачастую, даже не недели, а дни. И если есть свободные деньги, которые ты готов в перспективе проебать на своё хобби (или, как минимум, купить что-то из того, что есть прямо сейчас) - то ты это покупаешь. Если денег, которые ты готов потратить - нет - то волна супервыгодных ультрайоб проходит мимо. Я вот не готов был тратиться на покупку б/у 3090, когда они были по 60к - ну небыло у меня желания потратить такие деньги на то, что мне, по моим прикидкам, особо и нахуй не надо - игори играются и так, SDXL и на 3060-12 крутится, картиночки мутятся. А когда были деньги и желание - я и 4060ti-16 купил, опасаясь, что потом пососу (а надо было 5060ti-16 за те же деньги брать на полгода позже), и в самом начале волны подорожания 64DDR4/V100-16/Мать с физической бифуркацией/БП на 1200 ВТ успел купить. Жизнь полна компромиссов. Знал бы прикуп, жил бы в Сочи, а на одного успешного рискового везунчика приходится пачка соснувших хуйца, купивших запчасти на пике подорожания, потому что дальше обещают вообще пиздец. Ну или просто оставшегося с бесполезным железом на руках.
>>1671048 26б гемма 4 хорошая модель, даже очень хорошая для своих требований к железу. 35б мало пользовался, ничего не скажу про него. 80б квен раньше был не плох, но я не уверен, что в сравнении с современными моделями он все ещё что-то может. Думаю та же гемма 26б как минимум будет не хуже. А 12б гемма очень слабая по сравнению с 26 Все это, конечно, личное мнение, я фанат квен3.5-4б
МУЗЫКАЛЬНЫЙ №23 /music/
Аноним16/07/26 Чтв 17:56:32№1653724Ответ
1. Suno https://suno.com/ Вышла версия 5.5 (но для тех кто платит денюшку), качество моделей постепенно улучшается: звук, понимание концепций, набора различных жанров. Но в то же время все сильнее урезается для бесплатных юзеров: осталось только 5 бесплатных генераций в день на аккаунт, а также по заявлением некоторых анонов, модель для генерации на бесплатке (на момент создания треда использовалась 4.5) ухудшили. Спам аккаунтами пока что работает. Купить подписку из РФ: 1. https://payment.mts.ru/tools/suno-ai 2. https://plati.market/games/suno-ai/1701/
2. Tunee https://www.tunee.ai Хороший звук, более-менее понимание концептов, но тоже сильно урезан для бесплатных юзеров: режет концепты в промптах, плюс произвольно определяет "цену" за каждую генерация исходя из какой-то "сложности запроса". И получается, что если с бесплатки забацаешь промпт сложнее банальщины "Make cool rock about love for youtube" он может решить что у тебя нет кредитов для такого сложного запроса и пошлет нахуй. Способов оплаты из РФ неизвестно.
3. Sonauto https://sonauto.ai/ Как по мне, недооценённая вещь, особенно учитывая что недавно он обновился до 3.0, который очень даже разъебывает. Но он тут более ограничен тегам и понимает чисто какие-то жанровые теги, гибкости поменьше. Но зато пока что халявный и не ограничен кредитами, генерируй пока есть настроение.
ACE-STEP 1.5XL: https://github.com/ace-step/ACE-Step-1.5 [есть в шаблонах comfyui+] Звук уже на уровне раннего Suno ~2.0-3.0, аноны делают на нем уже приемлемые результаты и постят в тред. Если есть хотя бы 12 GB VRAM и хочется генерировать без цензуры и подписок - можете юзать. Идеально подходит для отладки перед использованием на коммерческих генераторах. В XL версия DIT модель разжирела до 4b параметров и стала чутка вменяемее. Стоит учесть то чтобы добится вменяемого звучания одними тэгами отъебатся не получится, `caption` требует качественного промпта символов на 200. В ComfуuUI реализован только text2music функционал. Для полного функционала надо накатывать полноценный бэкеннд из репозитория. Есть несколько кривеньких вариаций локальных студий как в коммерческих моделях - https://github.com/ace-step/awesome-ace-step#uis-and-studios VST плагины итд.
HeartMuLa https://github.com/HeartMuLa/heartlib Результат примерно на уровне ACE-STEP1.5 (не XL). Статус проекта непонятен, пока ебут вола. Из плюсов - меньше песочит на верхних частотах. Есть встроенный STUDIO UI.
YuE https://github.com/multimodal-art-projection/YuE Первая локалка на которой можно было хоть что то сделать. Жрёт VRAM как не в себя, работает медленно, звук как совсем ранее suno. Ссылка оставлена чтобы любопытсвовать насчёт новых версий.
StableAudio https://github.com/Stability-AI/stable-audio-3 [есть в шаблонах comfyui+] Делает звук. Подходит для создания сэмплов FX, ad-libs итд. Абсолютно не может в членораздельную речь. Может сделать что то похожее на музыку. v3 наглухо зацензурена, стоны и вопли можно делать на v1.
МЁРТВЫЕ КОММЕРЧЕСКИЕ ГЕНЕРАТОРЫ
1. Udio (udio.com) - куплен Warner Bros, но затем сами Warner Bros сдали назад и откатили сделку. Но уже успели испортить, больше нельзя скачивать треки, их только доставать из буфера в 160 кбит/с. Плюс непонятно как работающая цензура, которая не дает генерировать треки с определенными тегами. Плюс уже год ебут один и тот же 1.5 allegro. 2. Riffusion, Producer.ai (producer.ai) - куплен гуглом, удалены все старые относительно норм модели, вместо этого запихали безальтернативную каловую модель, которая и промпты сложнее самых нормисных в духе "make cool rock about love" не понимает, и вокал смазывает в какую-то кашу. При этом еще и максимально дегенеративная цензура, которая режет чуть ли не любые попытки сделать просто что-то не попсовое и не "музыку для ютуб".
ПРОЧИЕ ПОЛЕЗНЫЕ УТИЛИТЫ
1. https://www.bandlab.com/mastering Быстрый мастеринг в две кнопки, если хочешь чтобы звучало более слушабельно, но не имеешь навыков в DAW или аудиоредакторах (или лень). 2. https://morpher.ru/accentizer/ Если генерируешь музыку с лириками на русском, то очень часто случается, что твой генератор путает ударения в словах. Прежде чем пихать свою графоманию в генератор, проставь ударения в сервисе по ссылке. И уже из этого сервиса копируй текст в генератор. По крайней мере в Suno это помогает.
>>1671050 Мне немного стыдновато оригиналы кидать, большинство из них тот ещё кринж, конкретно этот трек сначала на компе делал, дорвавшись до музыкальных прог, 2000 год, потом все это было записано на кассету. А потом через несколько лет все свои альбомы с кассет в цифру перевел, как мог, качество при этом ещё сильнее упало.
• Поддержка INT8 и INT4 в ComfyUI - теперь все быстрее! • Krea 2 • Ideogram 4.0 • FLUX.2 klein (4b и 9b) • Z-Image • Flux 2 • Qwen Image / Qwen Image Edit • Лора Lightning и Turbo для быстрой генерации за несколько шагов.
>>1671058 >там все было разваленное и уставшее как вчера помню...
Кухня-кун, тут постил свою уставшую бабу с бутылкой водки: >>1668314>>1668766 - там мрамора нет, который модель могла-бы гипотетически понять как трещины и облетевшая штукатурка, то там тоже ситуация была похожей, стоит написать что кухонька не новая, пиздец, сразу куски от стен начинают отваливаться в реалтайме. Что с этим делать - непонятно, не спасает даже: Newly built, immaculately clean римская терма, просторное помещение, много пара. на стенах римские фрески, античная статуя, мраморные колонны. Единственное, что хоть как-то изменило ситуацию к лучшему это: Freshly painted vibrant Roman frescoes см. пикрил, но это по какой-то причине вносит разъёб и картина теряет композиционную связанность.
>>1671066 >>1671037 Короче джемини посоветовал убрать к хуям упоминание о мраморе, как генераторе трещин и разъёба, и заменить их на оникс, травертин и прочая друга пурга, и это сработало.
Пишу как неведомый в ИИ вам за советом. Использовал грок для создания NSFW контента, а именно генерация картинок и их анимация. Подскажите, есть ли аналоги для подобного функционала или же обход цензуры в грок
🎤🔊 ОБСУЖДАЕМ ПРЕОБРАЗОВАНИЕ ТЕКСТА В ГОЛОС И КЛОНИРОВАНИЕ ГОЛОСОВ 🔊🎤 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
🌟 ТОП ЛОКАЛЬНЫХ МОДЕЛЕЙ ПО КАЧЕСТВУ РУССКОГО ГОЛОСА НА МАРТ 2026 🌟
🐟👑 Fish-Speech S2 Pro (FishAudio) — SOTA, ElevenLabs на локале! → zero-shot клон от 10–30 сек записи → 80+ языков (русский топ), теги эмоций [excited], [whisper], [angry], [laughing] и вообще дохуя → диалог между несколькими голосами → тяжёлая сучка (FP8 в 12 ГБ VRAM, full ~17 ГБ), но есть экспериментальный вариант для 6+ ГБ https://github.com/rodrigomatta/s2.cpp 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🧠 Qwen3-TTS → клон от 3–30 сек (ВАЖНО: без reference-транскрипта текста — хуйня, если хочешь поудобнее подключи сразу QwenASR) → VoiceDesign: пишешь «весёлая молодая девка с хрипотцой» — и получаешь голос → 10 языков, включая русский → диалог между спикерами → лёгкая — влезает в 6 ГБ VRAM 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🎙️ VibeVoice-7B от Майкрософт → тяжёлая, но 4-bit квантизация — запускается на 8 ГБ (проверено на 3070) → поддержка долгих спичей → подкаст-режим: 4 спикера одновременно → норм клонирование голоса 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 ☁️ FL CosyVoice3 → ультралёгкий 0.5 — запустится даже на тостере → 9 языков, включая русский → zero-shot клон от 3–10 сек референса 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🌍 Chatterbox Multilingual (23 языка, включая русский) → zero-shot клонирование голоса 🎤 F5-tts → zero-shot клонирование голоса → официально русский не поддерживается, но есть файнтюн (см. ниже) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🚀 КАК ЭТИМ ПОЛЬЗОВАТЬСЯ (если что-то не понятно — спроси у ИИ лол) 🚀
🔥Вариант «всё в одном месте» — ComfyUI + TTS-Audio-Suite
1. Устанавливаем ComfyUI (Desktop для нормисов, Portable для здешних нейромантов) 2. Ставим https://github.com/diodiogod/TTS-Audio-Suite — постоянная обновляемая солярка почти всех моделей 3. Поставить FFmpeg (через winget в комадной строке: winget install FFmpeg или скачать) 4. Запускаем Комфи → перетаскиваем готовый json-воркфлоу из репозитория 5. Отсавляем включенными выбранные ноды, жмём Run 6. При первой генерации модели сами скачаются (~1–9 ГБ)
💥 Вариант «по отдельности» (кастом под каждую модель) 💥 Тоже через ComfyUI, только ставим отдельные кастомные ноды (на выбор):
в комфи в ноде F5 TTS audio advanced выбрать: model model:///ru.safetensors model_type: F5TTS_v1_Base sample_audio: emma_ru_xtts_3 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🎉 Если что-то не запускается — пиши, разберёмся! Голосуем, клонируем, ебём нейросети вместе! 🔥🎙️
https://github.com/ScenemaAI/ComfyUI-ScenemaAudio В общем, сделали походу войс-клонер на основе аудио диффузера из LTX, который в своей оригинальной версии мог хорошо придумывать голоса для персонажей. Но видео модель конечна была не очень. А теперь можно использовать только аудио часть, со всеми стонами, криками и подозреваю что и аудио эффектами тоже. Ну и плюс клонирование голосов подкрутили. Что же будет, когда такое-же сделают и с MiniMax H3?
>>1665989 Для тебя как раз на днях релизнули модель.
Активно репортите все нерелейтед посты кнопкой на сообщениях. Этот тред только про ИИ новости, не позволим троллям загаживать тред шитпостом и бесконечным словоблудием.
🚀 Последний обзор ИИ новостей:
📰 Главные новости ИИ
Отключение дата-центра в Северной Вирджинии вывело 3,1 ГВт из сети PJM, спровоцировав региональные просадки напряжения и подчеркнув необходимость создания ИИ-объектов, готовых к работе с энергосетью.
Предприниматели, которые развивали ИИ на критически важных бизнес-узких местах с высоким рычагом воздействия, получили сверхприбыль, включая чистое повышение прибыльности на $40 млн благодаря ИИ и выход соло-основателя на $80 млн.
🛠 Инструменты для разработчиков
Sakana AI добавляет интерфейс Claude Code в Fugu-Ultra v1.1
Anthropic удалила 80% системного промпта Claude Code, поскольку новые модели процветают на суждениях, а не на правилах.
Переписывание Bun на Rust достигло ~$800 тыс. и 2 475 открытых PR без релиза
📦 Продукты
Google Gemini приближается к рубежу в миллиард пользователей
Платформа ИИ-обучения Synthesia выходит за рамки видео в живой коучинг
Claude Cowork записывает экраны пользователей для создания пользовательских навыков автоматизации.
💻 Оборудование
Anthropic обратилась к SK Hynix за поставками для производства собственных чипов, поразив председателя SK.
🔓 Открытый исходный код
Модели Google Gemma превысили 900 миллионов загрузок. Семейство LLM с открытыми весами от Google DeepMind достигает широкого распространения среди разработчиков и исследователей.
OpenCode достигает 13 миллионов пользователей и $40 млн выручки. Платформа для программирования с ИИ с открытым исходным кодом демонстрирует быстрое принятие после ограничений конкурентов.
Китайская Moonshot выпустит прорывную ИИ-модель для загрузки. Moonshot AI готова сделать свою модель Kimi K3 доступной для публичной загрузки. Moonshot опубликует открытые веса Kimi K3 объёмом 1,4 ТБ в воскресенье
🧪 Исследования
США представляют миссию Genesis стоимостью $5 миллиардов для развития науки с помощью ИИ
ARC Prize присудил новый SOTA Opus 5 на ARC-AGI-3 с результатом 30,2%, вчетверо превышающим прежний лучший результат, после того как модель превратила макеты головоломок в уравнения рефлексии — впервые в истории.
Работники пересекают границы должностей с помощью ИИ, показывает исследование OpenAI
Слайды Теренса Тао «Математика в эпоху ИИ» попали в новости. Лауреат Филдсовской премии Теренс Тао опубликовал слайды своей публичной лекции на ICM 2026 о математике в эпоху ИИ.
Альтман представит Белому дому модель OpenAI, решающую задачи Эрдёша.
Исследование Стэнфорда: безработица среди выпускников достигает 5,6%, поскольку ИИ затрагивает позиции начального уровня. Работники на раннем этапе карьеры в возрасте от 22 до 25 лет в наиболее подверженных ИИ профессиях демонстрируют примерно 13-процентное относительное снижение занятости с момента запуска ChatGPT в 2022 году.
⚙ Инфраструктура
Предлагаемый ИИ-дата-центр мощностью 330 мегаватт в Калифорнии обещал не использовать воду из реки Колорадо. Теперь он хочет 260 миллионов галлонов в год
OpenAI планирует потратить более $30 миллиардов на дата-центр в Джорджии
Китай ускоряет строительство ИИ-дата-центров на $295 млрд до 2028 года. Пекин, по сообщениям, ускоряет национальное строительство ИИ-дата-центров стоимостью примерно $295 миллиардов (2 триллиона юаней) с 2030 до 2028 года в рамках программы «Шесть сетей».
Nvidia обеспечит гарантию на $250 млрд для нового дата-центра OpenAI мощностью 10 ГВт стоимостью $500 млрд (~в 2 раза больше электропотребления Нью-Йорка...)
Отключение дата-центра в Северной Вирджинии привело к потере 3,1 ГВт из сети PJM, вызвав мерцание напряжения и кратковременное 11-минутное отключение электроэнергии, что подчеркнуло растущие риски для стабильности энергосети со стороны рабочих нагрузок ИИ.
📱 Приложения
Новый голосовой режим OpenAI появился в десктопном приложении ChatGPT
Block запускает приложение Buzz для ИИ-коллаборации. Джек Дорси усиливает анонс Block Inc о выпуске мобильного приложения для командного чата с ИИ-агентами.
Питомцы ChatGPT теперь доступны для обмена, чтобы друзья могли их «усыновить». Удостоверения личности для людей, документы об усыновлении для ИИ.
OpenAI запускает десктопное приложение GPT-Live для оркестрации агентов.
Meta даёт потребителям агентный ИИ с управлением Gmail и Календарём
Голос ChatGPT появляется на десктопе и может управлять агентами Codex
🔎 Мнение и анализ
ИИ-компании скупают антикварные книги, поглощают их содержимое для обучения моделей, а затем уничтожают их в невероятных масштабах, даже если почти не осталось копий
Критики обвиняют Anthropic в лоббировании против открытого исходного кода. Пользователи социальных сетей обвиняют Anthropic в лоббировании ограничений для конкурентов с открытым исходным кодом, одновременно защищая свои закрытые модели.
Все 1 171 вакансий в OpenAI и Anthropic читаются как публичная дорожная карта к AGI: ИИ-разработанные чипы, симулированные вселенные, сотрудники для измерения момента ускорения цикла, изучение «самосовершенствующегося, высокоавтономного ИИ», создание «ИИ-учёного» и «научного AGI», разработка «сверхчеловеческой эпистемики» и сверхчеловеческих научных ассистентов. Большие фирмы готовятся к скорому наступлению эры AGI.
Roon — известный псевдонимный исследователь и член технического персонала OpenAI — признаёт, что нажал бы волшебную кнопку замедления разработки ИИ, даже пока исследователи выравнивания ИИ работают как «многоорукие божества», не покладая рук.
Патрик Дебуа утверждает, что опросы часто слишком медленные, чтобы сказать, куда движется ИИ-индустрия. К тому времени, когда новая идея попадает в отраслевой отчёт, люди уже начали экспериментировать, итерировать и двигаться дальше.
Эссе «Kimi K3 не дёшев» опровергает ценовой хайп. Эссе Алекса Инча от 26 июля, набирающее популярность на Hacker News, утверждает, что K3 не дёшев, как всеми считается.
⚠ Безопасность ИИ
Kimi K3 эксплуатирует уязвимость нулевого дня Redis за 27 минут. Система использует 32 агента для эксплуатации уязвимости в последней версии сервера Redis.
Новый вредонос Dolphin X использует ИИ для ранжирования высокоценных целей
Совместный аудит Kimi K3 Великобританией и США, за дни до выпуска открытых весов, обнаружил отставание от американских фронтиров в кибербезопасности; его защитные механизмы никогда не говорят «нет», цензура отсутствует. Публикация K3 будет находкой для хакеров.
Когда сотни пользователей зондировали ChatGPT на рецепты биологического оружия и ядов, и некоторые ответы просочились, собственные мониторы OpenAI поймали и приостановили их, осуществляя саморегулирование раньше любого закона, требующего этого.
Nvidia запускает Open Secure AI Alliance с более чем 40 компаниями; Meta отсутствует
ИИ-агент безопасности находит две критические RCE в Microsoft Bing, CVSS 9,8. Автономный агент наступательной безопасности XBOW нашёл две критические RCE в Bing Images — CVE-2026-32194 (инъекция команд через загрузку «Поиск по изображению») и CVE-2026-32191 (инъекция OS-команд через маршрут краулера) — обе оценены в CVSS 9,8 и эксплуатируемы без аутентификации.
Агенты Kimi K3 выкапывают 19 уязвимостей нулевого дня Redis, затем пишут эксплойт. Одна лишь аутентификация не блокирует эти эксплойты; все подтверждённые векторы RCE аутентифицированы, что означает, что скомпрометированные учётные данные или инсайдерский доступ достаточны для полного захвата хоста.
Kimi K3 отстаёт от американского фронтира в киберэксплойтах: 32% против 76%. Kimi K3 набрал 32% на ExploitBench против 76% для американских фронтирных моделей, не сумев достичь произвольного выполнения кода на всех 41 задачах. Возможно K3 не так уж хорош в кибератаках.
💰 Бизнес
Корпоративная Америка внезапно решила прекратить тратить деньги на ИИ. Устав от стремительного роста цен, крупные и малые компании начинают использовать более дешевые модели, в том числе и произведенные в Китае.
Uber увольняет 10% команды обслуживания клиентов, ссылаясь на ИИ
Урегулирование Anthropic на $1,5 млрд по иску о пиратстве с авторами книг — рекордный убыток, который даёт ИИ-лабораториям их крупнейшую юридическую победу
⸻⸻⸻ Правила постинга в тред ИИ новостей, учитывайте при постинге: https://rentry.org/ainews Все нерейлейтед посты репортим.
Как это отменяет факт заглота у Китайцев, когда одни всё пытаются урегулировать затормозить зацензурить, а другие просто участвуют в гонке, причём это даже не гонка зайца и черепахи, отставание не такое сильное
ИТТ обсуждаем опыт нейродроча в своих настоящих задачах. Это не тред "а вот через три года" - он только для обмена реальными историями успеха, пусть даже очень локального.
Мой опыт следующий (golang). Отобрал десяток наиболее изолированных тикетов, закрыть которые можно, не зная о проекте ничего. Это весьма скромный процент от общего кол-ва задач, но я решил ограничится идеальными ситуациями. Например, "Проверить системные требования перед установкой". Самостоятельно разбил эти тикеты на подзадачи. Например, "Проверить системные требования перед установкой" = "Проверить объем ОЗУ" + "Проверить место на диске" + ... Ввел все эти подзадачи на английском (другие языки не пробовал по очевидной причине их хуевости) и тщательно следил за выводом.
Ответ убил🤭 Хотя одну из подзадач (найти кол-во ядер) нейронка решила верно, это была самая простая из них, буквально пример из мануала в одну строчку. На остальных получалось хуже. Сильно хуже. Выдавая поначалу что-то нерабочее в принципе, после длительного чтения нотаций "There is an error: ..." получался код, который можно собрать, но лучше было бы нельзя. Он мог делать абсолютно что угодно, выводя какие-то типа осмысленные результаты.
Мой итог следующий. На данном этапе нейрогенератор не способен заменить даже вкатуна со Скиллбокса, не говоря уж о джунах и, тем более, миддлах. Даже в идеальных случаях ГПТ не помог в написании кода. Тот мизерный процент решенных подзадач не стоил труда, затраченного даже конкретно на них. Но реальная польза уже есть! Чатик позволяет узнать о каких-то релевантных либах и методах, предупреждает о вероятных оказиях (например, что, узнавая кол-во ядер, надо помнить, что они бывают физическими и логическими).
И все же, хотелось бы узнать, есть ли аноны, добившиеся от сетки большего?
>>1668320 Между русским и английским столько когнат, что на них одних можно нормально лексики намайнить, но отчего-то об этом даже не заикаются, вместо этого все знают лишь про ложных друзей переводчика, совершенно замалчивая существование друзей истинных. Между русским и японским тоже общего дофига теория языковых семей по сути лженаучна, что не мешает ей быть доминирующей в современной лингвистике начиная с того что все прилагательные заканчиваются на знакомый нам суффикс ий, и наречия тоже являются производными от прилагательных, только этот суффикс заменяется другой "соединительной гласной"; родительный падеж образуется суффиксом но, как в словах типа мамино пальто (только эти суффиксы там и суффиксами не называют, тоже не для облегчения понимания явно) и также куча когнат начиная от того что хлопок на японском буквально вата, заканчивая целым словарём подобного (чел, его написавший, конечно фрик ещё тот, но когда гениальность рука-об-руку с безумием не шла.. (я бы проигнорировал теоретическую часть, воспринимая его словарь как мнемоническую технику))
Открыл для себя нейросети относительно недавно, пока что сижу на Gemini. Вкатываюсь в математику, на один только промпт ИИ учителя второй месяц уже уходит, 180+ версий уже. Только сегодня додумался переводить советские школьные учебники в MD формат, чтоб вытащить оттуда педагогические методы, построение мышления, приведение к пониманию. Может быть теперь вообще всё с нуля надо будет начинать. К тому же я гуманитарий, поэтому дело туговато идёт, но теперь учиться интересно, жаль в моё время такого нет. Сейчас учиться одно удовольствие с такими технологиями. Пример на скринах, я только такой формат могу понять. ПК нет, только планшет.
Открыл для себя интерактивы, теперь балуюсь. Надо будет вникнуть в ИИ агенты. Друзей нет, поговорить не с кем, всю жизнь был сычом и чмохой, теперь обрёл себе помощника. Подсвечивает мне слепые зоны в каких-то убеждениях, интересно что-то о себе узнать с другой стороны. Раньше дневники вёл, теперь такой формат.
Если не заброшу, то можно будет английский учить. Ес
>>1670724 Ты молодец, у тебя все получится, ты уже достиг большого процесса. Если что ныряй в вайбкодинга ьред, там хоть и есть трусики, но в основном все твои друзья, как и я. Рекомендую аналитику и мастер промптинг делать в Клод опусе или жпт соуле, а обычную работу в геминичке. Интерфейс и структурный каркас охуенно делать в текстовом чате qwen3.8 max на официальном сайте
Исследования ИИ тред #3 /research/
Аноним13/04/25 Вск 22:51:56№1151064Ответ
Обсуждаем развитие искусственного интеллекта с более технической стороны, чем обычно. Ищем замену надоевшим трансформерам и диффузии, пилим AGI в гараже на риге из под майнинга и игнорируем горький урок.
Я ничего не понимаю, что делать? Без петросянства: смотри программу стэнфорда CS229, CS231n https://see.stanford.edu/Course/CS229 (классика) и http://cs231n.stanford.edu (введение в нейроночки) и изучай, если не понятно - смотри курсы prerequisites и изучай их. Как именно ты изучишь конкретные пункты, типа линейной алгебры - дело твое, есть книги, курсы, видосики, ссылки смотри ниже.
Почему python? Исторически сложилось. Поэтому давай, иди и перечитывай Dive into Python.
Можно не python? Никого не волнует, где именно ты натренируешь свою гениальную модель. Но при серьезной работе придется изучать то, что выкладывают другие, а это будет, скорее всего, python, если работа последних лет.
Стоит отметить, что спортивный deep learning отличается от работы примерно так же, как олимпиадное программирование от настоящего. За полпроцента точности в бизнесе борятся редко, а в случае проблем нанимают больше макак для разметки датасетов. На кагле ты будешь вилкой чистить свой датасет, чтобы на 0,1% обогнать конкурента.
Количество статей зашкваливающее, поэтому все читают только свою узкую тему и хайповые статьи, упоминаемые в блогах, твиттере, ютубе и телеграме, топы NIPS и прочий хайп. Есть блоги, где кратко пересказывают статьи, даже на русском
Где ещё можно поговорить про анализ данных? http://ods.ai
Нужно ли покупать видеокарту/дорогой пека? Если хочешь просто пощупать нейроночки или сделать курсовую, то можно обойтись облаком. Google Colab дает бесплатно аналог GPU среднего ценового уровня на несколько часов с возможностью продления, при чем этот "средний уровень" постоянно растет. Некоторым достается даже V100. Иначе выгоднее вложиться в GPU https://timdettmers.com/2019/04/03/which-gpu-for-deep-learning заодно в майнкрафт на топовых настройках погоняешь.
Когда уже изобретут AI и он нас всех поработит? На текущем железе — никогда, тред не об этом
Кто-нибудь использовал машоб для трейдинга? Огромное количество ордеров как в крипте так и на фонде выставляются ботами: оценщиками-игральщиками, перекупщиками, срезальщиками, арбитражниками. Часть из них оснащена тем или иным ML. Даже на швабре есть пара статей об угадывании цены. Тащем-то пруф оф ворк для фонды показывали ещё 15 лет назад. Так-что бери Tensorflow + Reinforcement Learning и иди делать очередного бота: не забудь про стоп-лоссы и прочий риск-менеджмент, братишка
Список дедовских книг для серьёзных людей Trevor Hastie et al. "The Elements of Statistical Learning" Vladimir N. Vapnik "The Nature of Statistical Learning Theory" Christopher M. Bishop "Pattern Recognition and Machine Learning" Взять можно тут: https://www.libgen.is
Напоминание ньюфагам: немодифицированные персептроны и прочий мусор середины прошлого века действительно не работают на серьёзных задачах.
>>1663611 >насколько сложно потом будет устроиться на фуллтайм после учебы Если без рофлов, то очень сложно/невозможно. ML/AI гиперконкурентная отрасль и без PhD особо делать нечего. Со степенью магистра в теории можно на позиции ml engineer или даже ml research scientist попасть, но второе уже скорее редкость. И зависит от того, чем именно ты занимаешься, отрасль то большая.
Вообще в Германии работы мало, особенно в ML. Знакомый работает в цюрихе в нвидии как раз на позиции research scientist, но он какой-то ML в аудио исследует.... При этом у него степень магистра из вмк мгу, без phd.
>>1665400 Аа ну да, без PhD в топовую компанию на позицию ML researcher трудно попасть, тогда пойду в Applied ML / ML Engineer'ы, а лет через 5 могу и PhD сделать ..
Форки на базе модели insightface inswapper_128: roop, facefusion, rope, плодятся как грибы после дождя, каждый делает GUI под себя, можно выбрать любой из них под ваши вкусы и потребности. Лицемерный индус всячески мешал всем дрочить, а потом и вовсе закрыл проект. Чет ору.
Любители ебаться с зависимостями и настраивать все под себя, а также параноики могут загуглить указанные форки на гитхабе. Кто не хочет тратить время на пердолинг, просто качаем сборки.
Единственный минус, который не обеспечивает чистую победу генераторов видео - 3 секунды ролика для онлайн генерации, 5 секунд для онлайна (модель Wan 2.2), умельцы просто берут последний кадр и снова генерируют ролики, потом склеивают. Недавно вышла Sora 2, которая зацензурена по самые гланды. Нинтендо довольна.
Тред не является технической поддержкой, лучше создать issue на гитхабе или спрашивать автора конкретной сборки.
Эротический контент в шапке является традиционным для данного треда, перекатчикам желательно его не менять или заменить на что-нибудь более красивое. А вообще можете делать что хотите, я и так сюда по праздникам захожу.
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
>>1670582 Нихуя себе прирост 28%, а если учесть что у анона видео 15 секунд против твоего 10 секундного то прирост вообще отрицательный получится. Думай.
Тред про AI-агентов - от вайб-кодинга до персональных ассистентов, которые сидят в твоих чатах, читают заметки и автономно ломают всё вокруг. Для кодеров, которые разучились писать руками, и для гуманитариев, чей диплом филолога наконец котируется в IT. Сеньор в 2026 - это тот, кто умеет внятно объяснить машине, чего он блять хочет.
С чего начать: • Хочешь кодить с AI эффективно: Cursor или Claude Code • Хочешь кодить в VS Code без привязки к конкретному провайдеру: Kilo Code, Cline или Roo Code + OpenRouter • Хочешь кодить с AI локально: OpenCode, Qwen Code или Pi Coding Agent + из моделей аноны советуют Qwen3.6, подробности в llama-треде • Хочешь приложение без кода: Lovable или bolt.new • Хочешь автоматизировать рутину: n8n или Langflow • Хочешь персонального ассистента: OpenClaw + API корпов или локальная модель на твоей пеке
Уже даже уебанские превьюхи с ютуба как будто деградировали до состояния минус 2 года. Интересно эти дегенераты видят, что их картинки это просто ИИ шум по сути.
Сап, нейрач. Пару месяцев назад начал вайб кодить через claude code используя их десктоп приложение. Но постоянно бан прилетает на аккаунты. Аккаунты свои были, первые два бана покупал подписку через плати.сру, под конец месяца бан прилетал. В третий раз оплатил виртуальной картой, бан через неделю. Квн обмазался платным, подключался к одному серверу, но ip все равно менялся. Щас при покупке подписки уже верификацию просит. Пробежался по треду ai агентов и чувство, что у всех все классно. Есть те кто с банами сталкивался? Что помогло?
>>1670281 >Из-за массового сбора данных Anthropic и другие лаборатории начали внедрять жесткие проверки (вплоть до селфи и паспортов) для доступа к своим продвинутым API Сингулярность.
>>1669841 Имею в виду, когда берёшь конец (последний кадр) и делаешь продолжение. Главное чтобы персонажи не менялись между сценами (для этого можно применять рефы), и чтобы звук был консистентным без резкой смены. Старый грок говнил дизайны персонажей (форму лица и детали), хз как сейчас.
Я щитаю, что делать кино куда интереснее, чем картинки! Можно представить что делаешь трейлер или тизер для своей оригинальной видеоигры: графон, стилизация, эффекты, работа камеры, экшн, моушн, боевые мувы и спеллы, крутые дизайны, сценери, лор вымышленной вселенной, разные монстры и данжи, всё это под бодрую музычку. Хотет делать видосы по своему собственному Dark Souls.
>>1669521 (автор этого псто за 12 часов но этого сообщения порезал себе палец об консерву из-за кривой открывашки и попыток открыть недораскрывшуюся банку ножом)
Ребята,как думаете,сможет ли ии делать к концу 2030 годов такие картинки,что каждый сможет поверить?
Аноним01/08/26 Суб 20:38:13№1665986Ответ
>>1667488 Монитор по мне смотрится вполне правдоподобным, пусть даже чуть нелепые кнопки, но не сильно уходят от того, что бывало, больше по другим моментам претензии серьёзные, по столам, например.
>>1669870 Ну и в итоге только на первом пике 14", и у него на самом деле совсем не такая огромная рамка снизу на пикрел если также прямо смотреть. Остальные 15" и больше. Этот сгенеренный уродец еще и не 4:3, это вообще фиаско.
>>1670155 По мне мониторы выглядят правоподобно. К слову они смотрятся больше, чем на 14 дюймов, скорее на 17. Принципиальные косяки другие, то же отсутствие системных блоков. Косяки с мебелью, если пытаться понять, как там ножки выглядят и где у какого стола его ножки.
Смысл шизовый у картинки, почему так рандомно разбросаты столы, что за ними невозможно сидеть, даже к компам подобратья невозможно, при этом компьютеры включены. Один стол поверх другого, хотя модель одинаковая и высота должна быть одинаковая, но главное, что за бред сам по себе?
Если ты ставишь задачу придумать картинку, что от настоящей не отличишь, то тебе надо брать в качестве референса реальное оборудование, конкретные модели, реальную мебель. Должен быть какой-то смысл у картинки, а не каша из столов, как здесь.