Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 450 78 100
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №254 /llama/ Аноним 04/08/26 Втр 18:18:53 1668203 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
изображение.png 1850Кб, 1920x843
1920x843
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1665553 (OP)
>>1663069 (OP)
Аноним 04/08/26 Втр 18:23:00 1668207 2
Ебать. На абуче увеличили лимит на количество форматированных блоков?
Аноним 04/08/26 Втр 18:25:37 1668210 3
gemma-color.png 16Кб, 640x640
640x640
gemma 4 12b qat для 8 гб
gemma 4 12b q6_k + mtp для 16+ гб
gemma 4 26b a4b q6_k mmap + mtp для 24+ гб
gemma 4 31b q4_k_L + mtp для 24+ гб
Все остальные существующие модели выкиньте нахуй
Аноним 04/08/26 Втр 18:26:56 1668213 4
>>1668210
> mmap + mtp
> выкиньте нахуй
Начнём с тебя
Аноним 04/08/26 Втр 18:27:02 1668214 5
>>1668210
>mtp
Говно без задач.
>qat
Еще большее говно.
Аноним 04/08/26 Втр 18:28:39 1668216 6
>>1668210
>qat
>mtp
Пережим пережимыч отупляющий и без того далеко не умницу. Серьёзно, откуда взялся форс 26б как великой умняши?
Аноним 04/08/26 Втр 18:31:24 1668221 7
>>1668216
>Серьёзно, откуда взялся форс 26б как великой умняши?
Она умняша для своего размера. Из коробки. Как только ты начинаешь что-то поверх вертеть она превращается в тупня.
Аноним 04/08/26 Втр 18:32:53 1668223 8
>>1668216
> Серьёзно, откуда взялся форс 26б как великой умняши?
Великолепна для своего размера. В пух и прах разносит плотные модели прошлого поколения, все вплоть до 32б включительно.
Аноним 04/08/26 Втр 18:36:13 1668225 9
>>1668216
Из говногайда с шапки очевидно. Абу апасные модели всем загоняет, оп в гайде рекомендует лоботомита. Вот шизы и ведутся
Аноним 04/08/26 Втр 18:38:29 1668226 10
Аноним 04/08/26 Втр 18:39:56 1668228 11
>>1668225
>оп в гайде рекомендует лоботомита
Покажи лучшую модель для конфигурации 16 + 16 или 12/8 + 32, которая будет работать также быстро и иметь столько же мозгов. Альтернатива это только моешный квен, который чуть выигрывает только в унитазно-кодинговых задачах.
Аноним 04/08/26 Втр 18:40:12 1668229 12
>>1668226
>чайный клуб, Mallorie
Это один анон, 128гб господин, да ещё ггуф и весов нет. Чел у тебя в посте 3 ошибки! Не стыдно в шизах треда не разбираться?
Аноним 04/08/26 Втр 18:41:21 1668230 13
image 67Кб, 607x1080
607x1080
>>1668214
>>1668216
>mtp
>Говно без задач
>Пережим пережимыч
Буйные снова атакуют тред. Держимся.
Аноним 04/08/26 Втр 18:46:32 1668233 14
>>1668230
Хватит чуму разносить собака ебаная. Тесты mtp показали что он в большей части нетиповых задач срезает скорость вместо увеличения. Буквально без него у тебя условные 20 токенов, с ним 17. Прирост ты получишь только спрашивая почему трава голубая а солнце зеленое.
Аноним 04/08/26 Втр 18:48:03 1668234 15
1754689033210.jfif 36Кб, 415x738
415x738
>>1668228
>12/8 + 32

12+48. Что даст лучший результат - гемма 26б или квен 122б? Допустим у меня специфичный вкус на тысячелетних вампирш с детскими телами всякую нёх с когтями/хвостами/чешуёй. Какая модель будет лучше держать образ монстровайфу не сбиваясь и не забывая, что у неё не кожа а шерсть/чешуя, что она ниггер биггер дан юзер, и имеет хвост/рога/длинную зубастую пасть? Хотя бы на дистанции в 50к контекста.
Аноним 04/08/26 Втр 18:51:34 1668236 16
>>1668234
Вопрос был про 12/8 + 32, ты притащил 12+48. Ты долбаеб, скажи честно?
Аноним 04/08/26 Втр 18:53:54 1668237 17
>>1668234
>Что даст лучший результат - гемма 26б или квен 122б?
>гемма 26б
>квен 122б
Кто сильнее - кашляющий младенец или водородная бомба?
Аноним 04/08/26 Втр 18:54:41 1668239 18
image 75Кб, 752x546
752x546
>>1668233
>Буквально без него у тебя условные 20 токенов, с ним 17
Буквально без него 25т/c а с ним 40+ т/c в моэ гемме Q8 при РП на русском. Хотя если кривыми руками настраивать, то может и да... Забываю иногда сколько в треде хлебушков. Прошу прощения.
Аноним 04/08/26 Втр 18:57:08 1668242 19
>>1668236
У него SWA. Просьба отнестись с пониманием
Аноним 04/08/26 Втр 18:59:07 1668244 20
>>1668239
Ну если это рп уровня "ты меня ебешь" то да, mtp будет работать. Даже драфтовый лоботомит на 200M параметров догадается "ты меня ебешь" ответить.
Аноним 04/08/26 Втр 19:01:53 1668245 21
>>1668244
Какое там у тебя РП уникальное, что MTP не может сделать верных предположений? Нука показывай, умник.
Аноним 04/08/26 Втр 19:09:39 1668248 22
>>1668245
У меня одна системная инструкция только 2.5к токенов весит, и то это самый "лайт" вариант из которого я вырезал более специфичные вещи потому что гемма их слишком буквально воспринимает. Мультитокен сразу же идет нахуй потому что ему нужно соблюдать верную разметку и учитывать разные параметры. Попробуй выкинуть серафину вместо нее персонажа посложнее прописать, удивишься как хорошо твой мтп работает.
Аноним 04/08/26 Втр 19:14:43 1668251 23
>>1668248
Конкретики не будет, ясно.

Хз братан, наверное у тебя все плохо, мой MTP дал прирост 30% к tg. Специально бенчи делал.
Аноним 04/08/26 Втр 19:17:03 1668252 24
>>1668248
Лолд. Ну с другой стороны я даже рад, что гейткип теперь не только по мощности железа и его стоимости, но и по скиллу чтения и навыка разбираться. Пока одни получают опыт качественного (и вдвое ускоренного) РП, другие сидят на аблитках с 0,0000001 клд, меромеро всяких и довольно урчат на 20 т/c. Все счастливы и все довольны - а это главное =)
Аноним 04/08/26 Втр 19:17:08 1668253 25
>>1668244
> Ну если это рп уровня "ты меня ебешь" то да, mtp будет работать
Ага, ведь как известно, именно на этом тренируют mtp модели. Ебанат, в голос. Каждую неделю тред не перестает удивлять манядодумками и эзотерикой я так чувствую
А то, что он семплерами вероятности сжимает и рандомайзит, из-за чего эффект mtp снижается, это так, по хуйне
Мимо тоже 30% прироста в рп
Аноним 04/08/26 Втр 19:18:23 1668255 26
>>1668229
Так, погодите. ОП == чайный клуб == меллори == н..ЭКСТРЕМИЗМ? Железо так то сходится, у всех 24+128
Аноним 04/08/26 Втр 19:19:37 1668256 27
>>1668253
>семплерами вероятности сжимает и рандомайзит
На гемме? Кекнул.
Аноним 04/08/26 Втр 19:19:53 1668257 28
>>1668236
Всм притащил? Обсуждение шло не за конкретное железо, а за народные моехи для работяг.
>>1668242
>У него SWA
Это у тебя сва. Отвечал на строчку:
>Альтернатива это только моешный квен, который чуть выигрывает
С хуя вы оба разорвались в визг?

>>1668237
>кашляющий младенец или водородная бомба
Проиграл.
Аноним 04/08/26 Втр 19:20:06 1668258 29
>>1668253
>он семплерами вероятности сжимает и рандомайзит
Или это, или слишком агрессивная выгрузка, или файнтьюн/аблитерация. На них mtp тоже херово работает.
Аноним 04/08/26 Втр 19:24:00 1668262 30
>>1668257
>Это у тебя сва. Отвечал на строчку:
Отвечал не на пост, продолжающий обсуджение двух постов, а отвечал на строчку. Вот что бывает с теми, кто сидит на гемме и прочих с SWA моделях! Задумайтесь
Аноним 04/08/26 Втр 19:24:02 1668263 31
>>1668257
>Обсуждение шло не за конкретное железо, а за народные моехи для работяг.
Ты ответил на конкретное обсуждение по конкретным категориям. И в любом случае, 122B моделька это нихуя не народная моеха для работяг. Работяги в лучшем случае сидят на 16 + 32, уж никак не на 48 гигах, это вообще что за комбинация должна быть? Две по 16 и две по 8? Или три по шестнадцать? Или одна 32 и одна 16? Много таких работяг видел?
Аноним 04/08/26 Втр 19:25:44 1668264 32
>>1668255
И он же автор гайда. Олдфаги знают, только нахуя протыков искать? Есть и есть.
Аноним 04/08/26 Втр 19:49:09 1668279 33
Привет, аноны. В треде давно не был, подскажите, пожалуйста актуальную базу для ерп 16 врам + 32 рам, хотелось бы 15к контекста но можно и 10.
Аноним 04/08/26 Втр 19:52:41 1668283 34
>>1668279
Гемма 26b и гайд для новичков в ОП-посте, где написано как её запустить. С твоим конфигом там и 64к контекста спокойно влезут.
Аноним 04/08/26 Втр 20:16:16 1668302 35
>>1668250 →
Тензорпараллелизм когда все по х4 будет нерационален, только если разблокируют шину 4.0. В пайплайн параллелизме все как обычно, генерация упирается в один поток упирается в псп врама, который быстрый. Не будет ускорения выше, но и не будет негативного импакта от шин, если только там не совсем х1 чипсетный.
Вот если все будут на х16 - уже можно попробовать, ген точно ускорится, но что будет с пп - вопрос.
мимо
>>1668226
> 69a3
Too small
Аноним 04/08/26 Втр 20:27:51 1668307 36
>>1668226
Это поинтереснее
inclusionAI/Ling-3.0-flash
Аноним 04/08/26 Втр 20:28:27 1668308 37
Аноним 04/08/26 Втр 20:41:39 1668321 38
Жора так никогда и не добавил поддержку линг флеша 2.6
Жорик — ничто, вместо крови понос
Вместо мозга пронюханный жадный нос
Вместо сердца у Жоры мусорный бак
Жора, бля, конченный, нахуй, мудак
Аноним 04/08/26 Втр 20:44:56 1668322 39
Чел который тредов 10 назад жаловался что в категории 100-200B ничего не выходит, надеюсь ты рад. Теперь у тебя каждые 3 дня новая модель выходит.
Аноним 04/08/26 Втр 20:50:46 1668327 40
Аноним 04/08/26 Втр 20:54:22 1668331 41
>>1668322
И ни у одной нет поддержки в жоре. Лол.
Аноним 04/08/26 Втр 20:55:07 1668332 42
>>1668220 →
Подробнее? Пативен вряд ли отправят, но риск бана у некоторых провайдеров есть. Правильно понимаю?
Аноним 04/08/26 Втр 21:33:23 1668356 43
Блять как же мне хочется чтобы нейронки подружили с виртуальными намордниками и всё это работало 120 раз в секунду по каждому глазу. Как только что-то такое появится вы меня не вытащите оттуда нахуй. От меня на стуле останется только лужа малафьи, я сдрочусь до последней молекулы. Когда менты будут вскрывать дверь из-за того что кум начнет стекать по потолку соседей снизу, они меня внутри не найдут. Они ничего не найдут. Только обдроченное кресло, шлем и стойку из перегоревших паскалей с распечатанными пластиковыми турбинами.
Аноним 04/08/26 Втр 21:56:11 1668371 44
>>1668234
>Какая модель будет лучше держать образ
Любая если добавить напоминалку в post-history instructions
Аноним 04/08/26 Втр 21:57:26 1668373 45
>>1668237
Ну тут кстати хуй знает, большие квены почему-то говно, хуже 27б. Я бы тут ещё задумался на кого ставить.
Аноним 04/08/26 Втр 21:59:19 1668375 46
>>1668264
>автор гайда
Он же покинул нас или я что-то путаю
Аноним 04/08/26 Втр 22:04:08 1668377 47
>>1668375
Именно так, Ватсон. Оп не может быть автором гайда, это исключено. Иначе бы он обновлялся. Плюс оп одобрял этот гайд прежде чем добавить. История дала крутой оборот...
Так где же правда?
Аноним 04/08/26 Втр 22:06:12 1668379 48
Аноним 04/08/26 Втр 22:08:56 1668381 49
>>1668356
Наверняка из скайрима уже можно сделать такую сборочку.
Аноним 04/08/26 Втр 22:12:06 1668386 50
Антохи, подскажите, как заставить модельку писать меньше текста? Я гонял тут одну карточку с чубса, и ну и это пиздец, каждый респонс по 1,5-2к токенов. Я говорю пиши меньше блять, а он мне ок, пон и высирает те же две тыщи токенов но с разбиением, типа "прошла неделя/месяц/год". Чё за хуйня блять, как заставить аутпут стабильно быть в пределах 300-500 токенов без обрывов текста и без затупов?
Аноним 04/08/26 Втр 22:12:23 1668387 51
Новая модель от лягушатников! Наконец-то comeback от Мистралей!

https://mistral.ai/news/shieldstral/
3B open-weights multimodal safety classifier that outperforms models up to 7x its size
Аноним 04/08/26 Втр 22:16:59 1668392 52
1754417631696.mp4 460Кб, 480x272, 00:00:06
480x272
>>1668387
>Наконец-то comeback от Мистралей
>3B
Аноним 04/08/26 Втр 22:17:10 1668393 53
>>1668386
В словах диапазон выставляй. ИИ не видит кол-во высранных токенов, но можешь посчитать слова.
А вообще :

Narration & Formatting:
- Balance: Maintain a 50/50 balance between dialogue and descriptive action.
- Length: Keep responses concise. Use 1 to 4 paragraphs maximum.
- Dialogue: “Use speech quotes for spoken words.”
- Thoughts: Use italics for internal monologues. (Example: I can't believe he just said that, he thought.)
- Action: Use double asterisk for making accent on specific words and loud sound/voice.
- Action: Use plain text for exposition and movement.
Аноним 04/08/26 Втр 22:18:59 1668396 54
>>1668216
>Серьёзно, откуда взялся форс 26б как великой умняши?
Оттуда же, откуда большинство анонов пришло в этот итт - из /aicg/ загона. Тут большинству нужно рп, а в нем гемма показывает себя отлично. Вот только если выйти за пределы выкручивания хвостиков лисодевочкам, то сразу видно, какое оно тупое по сравнению с квеном. А ведь скоро выходит квен 3.8, который еще сильнее даст на ротан гейме во всём кроме creative writing.
Аноним 04/08/26 Втр 22:19:48 1668397 55
>>1668386
Be concise. Write short answers.
Проверь что нет конфликтов с карточкой и самим системным промптом для нарратора.
В карточках часто добавляют назидания на стиль ответов.
Еще можешь руками пару раз обрезать ответы, тогда мб нейронка подхватит суть.
Аноним 04/08/26 Втр 22:21:09 1668398 56
>>1668379
Понимаешь, ризонинг макс добавляет в начало инструкции фразу "баля, ну ты ризонь там максимально кароч". И всё. Я префиллом ризонинга намного большего достигаю.
Аноним 04/08/26 Втр 22:21:45 1668399 57
Аноним 04/08/26 Втр 22:23:10 1668401 58
>>1668396
>то сразу видно, какое оно тупое по сравнению с квеном
А можешь привести примеры в чем он лучше (кроме очевидного кода и агентских задач)?
Аноним 04/08/26 Втр 22:26:45 1668403 59
>>1668377
>Плюс оп одобрял этот гайд прежде чем добавить.
Как будто ОП не может быть хитрым манипулятором, одобряя свой собственный гайд и делая вид, что исчез.
Аноним 04/08/26 Втр 22:33:40 1668410 60
>>1668393
Спасибо, попробую. А это лучше в промт добавить или в пх? У меня в постхистори сейчас сорта "держи персонажа, мразь". Одна инструкция не захуярит другую?
Ещё попробую ограничить лимит слов. 200 норм будет, это сколько токенов примерно? ~400? Как лучше об этом написать? Что-то типа "Limit response to 200 words or less"?
>>1668397
Не поверишь, я так и сделал. Раз срезал, два, три, четыре. Всегда работало, но в этот раз нейромозг как срал стенами текста убивая флоу, так и продолжил срать. Пришлось в тред зайти спросить.
>Проверь что нет конфликтов с карточкой
Нету. Карточка неплохая, на 2.5 токенов, без слопа, с адекватной разметкой. Хз чё моделька так перевозбудилась в этот раз.
Аноним 04/08/26 Втр 22:34:29 1668411 61
MiniMaxH300045.mp4 1286Кб, 1376x768, 00:00:07
1376x768
Аноним 04/08/26 Втр 22:39:30 1668415 62
>>1668403
Вот и я так думаю. Меллори это чайный клуб, его посты в прошлом треде были. Никуда не делся. Оп скорее всего заебался гайд поддерживать вот и слился. В эту версию верю, в ней противоречий нет. Скандалы интриги расследования.
Аноним 04/08/26 Втр 22:41:51 1668418 63
>>1668410
Пихать в систем промпт. Там подправь чуть чуть, я с черновика скопипастил, там не отредактирован и чуть лишнего, но суть я думаю понятна.
На глаз в таверне оцени, сколько тебе слов надо. удали в сообщении лишний текст. Посмотри сколько токенов сообщение занимает. И сделай диапазон от N-20% до N+20% в систем промпте.
Аноним 04/08/26 Втр 22:42:01 1668419 64
>>1668410
В карточке примеры диалогов есть? Если они через <start> подаются и там большие ответы то вот причина.
Аноним 04/08/26 Втр 22:42:04 1668420 65
>>1668192 →
Я тестил у него, нормально работает для своих размеров

>>1668206 →
Так это и есть Gemma 4 26b a4b ванильная, просто квантована до 12.4Гб
Аноним 04/08/26 Втр 22:53:48 1668431 66
>>1668398
На конкретно этом префилле проходило обучение. Расскажи, чего и каким префиллом достигаешь
Аноним 04/08/26 Втр 22:56:27 1668434 67
>>1668418
Спасибо за совет с диапазоном, это и правда лучше сработает. Всё понял, пойду чинить.
>>1668419
Нет, нету. Но тоже спасибо, теперь буду знать, что старты нужно убирать.
Аноним 04/08/26 Втр 23:05:13 1668437 68
Господа, там Квен 3.8 не обещают в формате МОЕ на 100-150B?
Я просто потыкал на апи Квен 3.8 MAX (сколько он там, 2,4Т?) и мне понравилось для ролеплея, хотелось бы получить небольшой кусочек сего локально (хуй с ней, с цензурой, у меня безъебабельный ролеплей пополам с блокнотингом).
Или будет только 27B плотняша и всё?
Аноним 04/08/26 Втр 23:05:21 1668438 69
Поставил гемму по гайду, ерп что-то не идет, очень сухо и без описаний почти, только факты. Системный промпт нужен? Может кто-нибудь поделиться?
Аноним 04/08/26 Втр 23:06:19 1668441 70
1785873877312.jpg 28Кб, 720x366
720x366
>>1668437
Обещают хуй к носу приложить
Аноним 04/08/26 Втр 23:08:39 1668444 71
>>1668441
В прошлый раз было так же, типа ни в коем случае не будет никакого квена, кроме квена3.5, иц овер. А потом взяли и выгрузили 3.6, и с этим так же будет.
Аноним 04/08/26 Втр 23:11:45 1668445 72
>>1668441
Печально сие.
Не заботятся господа хорошие о качестве моего ролеплея в автономном варианте.
А ведь могли бы увеличить количество тёплоты, лампоты и превозмогания, сгенерированных локально.
Аноним 04/08/26 Втр 23:16:34 1668449 73
>>1668431
>На конкретно этом префилле проходило обучение.

Так это даже не префилл, а тупо инструкция.
Замени его любой другой инструкцией с таким же смыслом - и наблюдай как она ничуть не хуже будет ризонить.
Аноним 04/08/26 Втр 23:17:59 1668451 74
>>1668396
Дак тупо нет ни одной модели, которая лучше геммы в соотношении интеллекта на скорость и вес модели.
Аноним 04/08/26 Втр 23:24:26 1668454 75
>>1668449
> Так это даже не префилл, а тупо инструкция
Инструкция, которая предшествует всем предыдущим, инжектится в начало. Самый настоящий префилл. Посмотри внимательнее на Жинжу, если тебе это интересно. И да, в том числе на этой инструкции в конкретном месте проходило обучение. Дипсик поддерживает структурный вывод и обучался на этом, что тоже есть в Жинже, подробнее в бумажках и статьях лабы.
>>1668126 →
> странно что Жоржанов ему противится.
Ничего подобного: https://github.com/ggml-org/llama.cpp/pull/26452
https://github.com/ggml-org/llama.cpp/issues/26369
> Support FP8 base model conversion
Все будет, но не сразу.
Аноним 04/08/26 Втр 23:27:10 1668455 76
>>1668454
> всем предыдущим
В рамках последнего инпута, конечно же. Пока меня тут снобы и любители полемики не съели.
Аноним 04/08/26 Втр 23:54:49 1668471 77
>>1668454
>Инструкция, которая предшествует всем предыдущим, инжектится в начало. Самый настоящий префилл.
Я имел ввиду что не префилл ризонинга.

>Посмотри внимательнее на Жинжу, если тебе это интересно.
Я знаю как там все устроено, я те инструкции уже внес в свою жинжу и даже добавил свои кастомные инструкции для low и medium ризонинга, написанные по аналогии. И они прекрасно работают.

> И да, в том числе на этой инструкции в конкретном месте проходило обучение.
Ты небось еще и из секты тех кто считает что пользовательские инструкции могут лоботомировать модели и потому той же аблитерации надо обязательно обучать.
Аноним 04/08/26 Втр 23:58:14 1668476 78
>>1668262
>отвечал на строчку
Как и все абсолютно здоровые люди. Только шизы с окр и гиперфиксацией отвечают на каждое слово в посте, а не на интересующую их часть. Pow core mill.
>>1668263
Ну так тут есть олигархи и с 128 и 64. У меня скромные 48. Вполне народные числа. От занимаемых плашками слотов мазерборды суть вопроса не изменилась. 26 гемму нахваливают с такой силой, что кажется будто она уделает даже крупномое и плотнях. И где обширные тесты, мнения, факты?

В прошлом треде был чел у которого 26б-умняша в восьмом кванте умудрилась проебать элементарную "" разметку, не забыв приправить текст излюбленным квеновским "—". У - умняша.
Аноним 04/08/26 Втр 23:58:23 1668477 79
>>1668471
> Ты небось еще и из секты тех кто считает что пользовательские инструкции могут лоботомировать модели и потому той же аблитерации надо обязательно обучать.
Где я в своем посте сказал что-нибудь плохое про пользовательские инструкции? Снова ищешь от кого ущемиться? Зачем? Рад, что у тебя все хорошо работает. И квант у тебя хороший. Только не взрывайся.
Аноним 05/08/26 Срд 00:03:09 1668482 80
>>1668396
> Вот только если выйти за пределы выкручивания хвостиков лисодевочкам
Ответственно заявляю что 26 для этих дел слабовата. Ты не только будешь удивляться ее забывчивости и неуместным реакциям, но и: не опишет нормально текстуру и структуру меха, не отличает глажку у кончика и основания, не понимает разницу между хвостовым и ушным мехом, вообще не понимает физику мокрого, так еще через 3 поста чар перевозбудится и прыгнет к тебе на хуй.
31 еще как-то, но тоже часто недостаточно.
мимо ценитель
Аноним 05/08/26 Срд 00:10:08 1668490 81
>>1668454
> Support FP8 base model conversion
Это не похоже на
> new ggml data format - fp8
и линк стоит на спекулятор.
>>1668476
> 26 гемму нахваливают с такой силой, что кажется будто она уделает даже крупномое и плотнях
Да потому что 12-гиговые и хуже бедолаги способны только ее запустить и она позволяет иметь хоть какое-то рп. Года два с такого перфоманса бы ахуели, да и если ты непритязательный - на безрыбье и гемма топ рп. В треде куча неофитов которым она норм, а с другими моделями сложности по железу или навыку.
Аноним 05/08/26 Срд 00:14:10 1668494 82
>>1668482
>Ответственно заявляю что 26 для этих дел слабовата.
Гемма в принципе во всем слабовата если реально смотреть на её производительность и полезность. Два её единственных плюса - приличный русский язык и очень хорошая скорость. Просто в её размере больше нет конкурентов. Квен 35B с натяжкой, потому что жрет больше и требует больше. Остальные конкуренты это старье на которое уже без слез не взглянешь.

Но даже так, русский геммы сильно быстро заебывает. Она сама по себе не может в вариативность и имеет примерно два чойса на следующий токен, так еще и русский это второстепенный для нее язык и там еще меньше разнообразия. Короче лично я вернулся на мистральский слоп до лучших времен. Пока не обновлю систему или пока не выйдет что-то еще из мелочи.
Аноним 05/08/26 Срд 00:17:34 1668499 83
>>1668482
>вообще не понимает физику мокрого, так еще через 3 поста чар перевозбудится
>пишешь: мокрый хво...
>гемма4: WET... CUNT? I GET IT! LET'S FUCK!

Ещё у геммы странная сосредоточенность на посторонних вещах. Я как-то пытался с Серафиной по душам попиздеть, просто уютный хендхолдинг в залитой солнцем роще, чистый холсом. Так гемма стала придумывать каких-то лесных существ, какие-то потусторонние силы правящие рощей, какие-то договоры на крови и ледяные ветра пронизывающие кожу. Я аж в карточку полез, чтобы проверить, нет ли там такого. Спойлер: там такого нет. Гемма с потолка начала сочинять то, чего не должно было быть, в итоге уведя повествование в дебри, в которых сама запуталась, забыв и про меня и про Серафину, начав галлюцинировать какую-то отдельную от нас историю. А мы с Серафиной би лайк: "Можно мы уже пойдём?"
Аноним 05/08/26 Срд 00:18:19 1668502 84
Дипсик действительно соевый и позитивный. Софтрефузы, редиректы на месте. Когда совсем некуда деться - выдает рефузы. Предыдущее превью было таким, 0731 и того более.
Аноним 05/08/26 Срд 00:29:29 1668512 85
>>1668494
> я вернулся на мистральский слоп до лучших времен
Держись там! Скорейшего апгрейда, а то совсем захвораешь.
>>1668499
А случаем нет никаких дополнительных и огромных инструкций и шизопромптов? Типа "пиши имеерсивно, захватывающе и много", только в виде полотна.
Хотел вот так угодить, другой бы восхитился насколько она инициативная, а ты носом воротишь. Абсолютно закономерно надо сказать, модель должно понимать настроение юзера, когда он хочет просто спокойно посидеть и поговорить, когда хочет обниматься, кумить или куда-то двигаться.
> начав галлюцинировать какую-то отдельную от нас историю
Хуясе ебать
Аноним 05/08/26 Срд 00:41:15 1668523 86
>>1668512
Нет конечно. Было бы не удивлялся бы.
>пиши имеерсивно, захватывающе
Иммерсивно и захватывающе не равно "уводи сюжет в дебри". Иммерсивно и захватывающе можно описывать даже высыхание краски, оставаясь на месте. Я поэтому и люблю хартфайр. Он натаскан на то, чтобы ты со своей вайфой сидел у костра 100к контекста и беседовал по душам.
>другой бы восхитился насколько она инициативная
Но ведь это Я инициатор и главное действующее лицо. Я задаю направление сюжету, выбирая что и куда дальше разовьётся. Если бы я хотел посмотреть тв, я бы включил тв, евпочя.
>модель должно понимать настроение юзера
У геммы свой путь. Шизопуть. И ты на нём - помеха.
>Хуясе ебать
Забавно, один раз. А потом ты приходишь в чайный клуб чтобы погладить девичьи хвостики, а вместо этого на вас падает метеорит и начинается зомби апокалипсис.
Мне так однажды наикозиейший наихолсомнейший роадтрип с вайфу гемма превратила в хоррор с элементами гуро. Говно блять. Для хоррора с гуро у меня есть специальные карточки. А эта вам не это. Эта для другого. Но для геммы всё едино.
Аноним 05/08/26 Срд 00:43:55 1668526 87
>>1668523
>100к контекста
>24b
>мистралетюн
Даже боюсь справшивать
Аноним 05/08/26 Срд 00:50:10 1668536 88
>>1668523
> Я поэтому и люблю хартфайр. Он натаскан на то, чтобы ты со своей вайфой сидел у костра 100к контекста и беседовал по душам.
Линк?
> Но ведь это Я инициатор
Это к тому, почему у других может быть совершенно иное мнение, такое наоборот по первой воспримут как манну небесную.
Аноним 05/08/26 Срд 01:16:28 1668549 89
Сегодня день рождения GPT OSS! 120б моделька в матеше и котинге ебала ВСЁ вплоть до Глм 4.7 и жирных 1Т+ моделей. Будут ли ещё такие гемы от попенов это неизвестно...
Аноним 05/08/26 Срд 01:54:41 1668557 90
MiniMaxH300049.mp4 827Кб, 608x352, 00:00:12
608x352
Аноним 05/08/26 Срд 01:59:05 1668558 91
>>1668549
> ебала ВСЁ
В перерывах глотала или сплевывала?
Аноним 05/08/26 Срд 02:05:05 1668561 92
>>1668558
Сорян, не всем интересен дроч. Как ассистент и задачерешатель оче неплохая моделька была, долгое время держалась. QAT из коробки тоже делал ее привлекательной.
Аноним 05/08/26 Срд 02:24:02 1668567 93
MiniMaxH300051.mp4 1024Кб, 608x352, 00:00:15
608x352
Аноним 05/08/26 Срд 02:36:56 1668571 94
>>1668561
Не дрочем единым, трудно представить себе задачи где она была бы настолько хороша чтобы соответствовать тому описанию. Код - слаб, довести до конца задачу у нее вызывало трудности. Дебаг или анализ готового проекта - с трудом понимает содержимое, путается, предлагает ошибочные решения. Контекстное окно на момент рилиза уже мало, четверть от него съедается максимальным ризонингом.
Аноним 05/08/26 Срд 03:10:26 1668578 95
1785888627593.png 217Кб, 1577x762
1577x762
Дособрал я это рокм под мишки, накатил жору и это пиздец.
+30% к тг, -30% к пп 🤡
Аноним 05/08/26 Срд 06:59:58 1668617 96
exllama.png 311Кб, 2191x760
2191x760
vllm-context.png 166Кб, 952x1344
952x1344
vllm-before-war[...].jpg 84Кб, 521x363
521x363
vllm-after-warm[...].jpg 38Кб, 558x370
558x370
fuck-this-shit.png 218Кб, 1872x747
1872x747
condom-for-b30-[...].jpg 2481Кб, 4000x3000
4000x3000
>>1668250 →
Пока на Gen2 x4, хотя на моих картах сейчас по x16 линий распаяно спасибо доброму человеку.

Я когда раньше тестировал TP на своих 3090/4090/5090, то пришёл к выводу, что, при Gen3 x4, тензор-параллелизм даёт профит только на плотных моделях, а вот для MoE такого канала связи мало - при пайплайн-параллелизме скорости у меня выше выходили. Жалко только, что ссылку на рентри потерял - кидал прошлой осенью бенчи на своём конфиге, так бы мог подтвердить цифры.

В случае 170HX их пока смогли анлокнуть только до Gen2. Поэтому, вероятно, TP может быть имеет смысл если их все посадить на условные x16 линий, но на моей текущей платформе я не могу себе такого позволить.

Планирую пока сидеть на пайплайн-параллелизме, а, в этом случае, PCIe-линии фактически не могут боттлнекаться т.к. активации между слоями копеечные, хоть на Gen1 x1 сажай это всё.

> будет сильно больше чем на ddr5 под разгоном
Тут хз если честно - по хорошему сравнивать надо в рамках одного движка т.к. даже на одинаковом конфиге, но на разных движках, скорости сильно отличаться могут. При этом выгрузка в RAM из +/- мейнстримных движков поддерживается только в жоре и в ktransformers. С жорой у меня много негативного опыта было в плане скоростей и качества квантов (при сравнении с квантами аналогичного размера для vllm/exllama), хотя понятно, что это, вероятно, лучший вариант для случая "1 карта + много RAM". Для ktransformers нужен гомогенный конфиг с видеокартами, с чем у меня раньше были проблемы, поэтому его толком не смотрел. Ещё буквально неделю-две назад для exllama запилили возможность выгрузки в RAM, надо разбираться.

Скидываю первые тесты при делении поровну по 6 картам на том, что было под рукой:
1. exllama Step-3.7-Flash 6.0bpw (196B A11B): при 58к контекста 1.3k pp/s, 27 tg/s
2. vllm Qwen-3.5-122B fp8 (A10B): при 50к контекста 11k pp/s да, 84 tg/s

По хорошему надо по нормальному бенчи погонять, но пока некогда было. По быстрому pp на vllm я перепроверил на нескольких длинных чатах - контекст действительно считается на уровне 10-11к токенов/сек в одном запросе, что выглядит очень вкусно.

В случае vllm там fp8 квант, а 170HX не имеет для него нативного ускорения - в идеале тут бы int4 кванты потестить. Да и что-то на полный набор VRAM загрузить, а то тот же 6.0bpw квант степа - это только около половины доступной мне сейчас VRAM.

Что-то я знатно сегодня вернее уже вчера подзаебался, пока подключал-настраивал эти 170HX, хотя там проблема больше в райзерах была и в собственной криворукости, а не в самих картах.
Аноним 05/08/26 Срд 07:11:32 1668619 97
>>1668617
Так че новая мета вот это некроговно вместо 3090? Че по игрулькам и стабл дифужену, видосы генерит?
Аноним 05/08/26 Срд 07:19:29 1668624 98
>>1668619
Воркфлоу на комфи для анимы что 8 сек на моей 5090 отрабатывал, на 170HX отрабатывает за 12 сек. Так-то неплохо с учётом того, что памяти тут в два раза больше, а цена в 3-4 раза ниже.

По остальному хз, не смотрел пока. Для видеогена возможно хопперы/блеквеллы поинтереснее будут за счёт поддержки fp8/fp4, там это сильно ролляло для того же Wan, хотя не знаю насколько это с новым MiniMax H3 актуально, не было пока возможности посмотреть его.
Аноним 05/08/26 Срд 07:52:31 1668633 99
>>1668499
>Так гемма стала придумывать каких-то лесных существ, какие-то потусторонние силы правящие рощей
Сука долбоёб.... Это в лорбуке всё. Задеваешь случайно слово активации (одно из слов "лес" насколько помню) и получаешь лором в еблет.
Пиздос, тредовики не знают как таверна работает. Отправлю вас всех в буткэмп /aicg/
Аноним 05/08/26 Срд 09:12:10 1668660 100
>>1668617
>>1668624
Ну че, выходит это всё не наёб был, прикольно за 8к таких накупить пачку.
Но для нищуков момент упущен, остаётся ждать рам за 150р/гиг опять
Аноним 05/08/26 Срд 09:20:14 1668662 101
>>1668660
Как обычно - ждуны сосут
Аноним 05/08/26 Срд 09:25:55 1668665 102
>>1668662
Ну не в этот раз. Если щас её брать это цена 64гб ддр5 в днс да и по миру, ну т.е кто хотел себе память по такой цене тот уже купил. Все ждут подешевления рам, каждая живая душа с пк, и оно наступит, как с видяшками. Не может мафия вечно наживаться на простых работягах.
Аноним 05/08/26 Срд 09:29:43 1668668 103
>>1668633
>Сука долбоёб
Зачем ты так о своих родителях. Они же старались...
>Задеваешь случайно слово активации (одно из слов "лес" насколько помню) и
Лорбук был отключен.
>Пиздос
Действительно пиздос, когда не знаешь о чём речь, но спотыкаясь бежишь доказывать, что постер в треде не прав.
Аноним 05/08/26 Срд 10:44:02 1668705 104
>>1668499
У меня 12б тройка так себя вела. Четвёрку, наоборот, приходится пинать ногами, чтобы она поднимала жопу и двигалась дальше по рп, не зацикливаясь на старых сценах. Даже с инструкциями продвигать сценарий и чаще брать инициативу в свои руки за персонажей.
Аноним 05/08/26 Срд 12:40:43 1668788 105
Анон, посоветовавший для дипсика сохранить все слои в оригинальных квантах, кроме экспертов. Сделал квант и он как будто реально меньше ошибается и чуть лучше работает. Пришлось конечно сгрузить один мое-слой на цпу и потерять примерно 0.4 т.с. и 30 пп. Зато куча освободившейся видеопамяти позволила загрузить дипсик с -np 2.

Вот рецепт, если кому надо, использовать с квантом батрухи.

^blk\.\d+\.ffn_gate_tid2eid\.weight$=i32

^blk\.[0-2]\.ffn_(gate|up|down)_exps\.weight$=mxfp4
^blk\.\d+\.ffn_down_exps\.weight$=mxfp4
^blk\.\d+\.ffn_gate_exps\.weight$=q3_K
^blk\.\d+\.ffn_up_exps\.weight$=q3_K

^token_embd\.weight$=bf16
^output\.weight$=bf16

^blk\.\d+\.ffn_gate_inp\.weight$=bf16

^blk\.\d+\.attn_compressor_(gate|kv)\.weight$=bf16
^blk\.\d+\.attn_compressor_ape\.weight$=f32

^blk\.\d+\.indexer\.proj\.weight$=bf16
^blk\.\d+\.indexer_compressor_(gate|kv)\.weight$=bf16
^blk\.\d+\.indexer_compressor_ape\.weight$=f32

^blk\.\d+\.hc_(attn|ffn)_fn\.weight$=f32
^output_hc_fn\.weight$=f32

^blk\.\d+\.attn_(q_a|q_b|kv|output_a|output_b)\.weight$=q8_0
^blk\.\d+\.indexer\.attn_q_b\.weight$=q8_0
^blk\.\d+\.ffn_(gate|up|down)_shexp\.weight$=q8_0
Аноним 05/08/26 Срд 12:52:47 1668796 106
Аноним 05/08/26 Срд 13:10:33 1668812 107
>>1668788
н*ня хуйни не посоветует
Аноним 05/08/26 Срд 13:25:14 1668824 108
>>1668788
Рад, что пригодилось.
> -np 2.
Не забудь сделать -kvu. По дефолту включается только если не трогать -np.
>>1668796
Он даже чуть лучше, потому что есть imatrix. Свой я тоже собирал с imatrix, от tarruda. Предвосхищая русикосрачи: нет, он не вредит русику. Проходили уже, были и PPL/KLD сравнения. Никакого трейд оффа нет, это просто лучший способ квантования, сложность - знать об этом и подобрать подходящий imatrix, они отличаются по архитектурам, для каждой желательно свою imatrix. Так будет эффективнее, но ни одна не навредит.
Аноним 05/08/26 Срд 14:04:49 1668838 109
Аноны, есть вопрос про Chat и Text Completion. Какая реальная разница в использовании имеется? Понятно что при TC нужно самому всё настраивать, но меня волнует именно функционал. Есть что-то в одном из этих режимов, чего нет в другом? Единственное что я нашел и что реально неудобно - в Chat Completion невозможно продолжить генерацию на месте обрыва сообщения. То есть нужно делать отдельный запрос по типу "продолжи вот с этого места". Но кроме этого еще что-то есть?
Аноним 05/08/26 Срд 14:10:08 1668843 110
>>1668838
> Chat Completion невозможно продолжить генерацию
Как в лламе не знаю, в вллм можно

> Есть что-то в одном из этих режимов, чего нет в другом?
Мультимодальность
Аноним 05/08/26 Срд 14:15:07 1668849 111
>>1668838
Разница в возможности залезать ручками в то, что подается модели и в каком формате. Чат комлишн работает с жинжей и её разметкой. Тексткомплишн полностью тебе на откуп. Ты сам формируешь разметку, блоки, суффиксы, проставляешь теги.
Зачем? Деды так делали ну и для всякого объеба ассистента. Из недостатков: отсутствие удобного контроля ризонинга у современных моделей и общее неудобство.
Аноним 05/08/26 Срд 14:15:11 1668850 112
>>1668578
>4 x MI50 после ебли с билдами все еще медленнее одной RX9700 на ванильном релизном билде
держи в курсе, суходроч
Аноним 05/08/26 Срд 14:16:32 1668851 113
>>1668617
> при 50к контекста 11k pp/s да
Ар ю ахуели там? Жирно весьма, что именно за квант? На них не все фп8 должны заводиться, или это с патчами под ампер?
> тут бы int4 кванты потестить
Есть int8 w8a8 где должно прямо аппаратное сработать, но они экзотичны. Но можно попробовать сделать самостоятельно.
>>1668660
Сразу об этом писалось, пеняйте на трясунов, которые цирк устроили. Они пока продаются чуть дороже 3090, так что шансы еще есть.
>>1668838
> Chat Completion невозможно продолжить генерацию на месте обрыва сообщения
Это "незадокументированная" фича в официальном стандарте и у корпов не поддерживается, потому многие бэки ее не имеют. Но технически с локалками таких ограничений нет.
> Но кроме этого еще что-то есть?
Есть тут любители ломать разметку чтобы изменить поведение сети, в чаткомплишне для такого потребуется править сам шаблон и перезагружать модель. Зато в нем есть картинки и функциональные вызовы.
Аноним 05/08/26 Срд 14:18:17 1668853 114
>>1668849
Можно и в жижу залезть своими руками, но будто те кто дрочат темплейты не могут принять жижу по идеологическим причинам
Аноним 05/08/26 Срд 14:20:39 1668856 115
>>1668838
В Chat Completion есть Tool calling и возможность скинуть нейронке картинку. Плюс некоторые темплейты ты без на Chat Completion хрен сделаешь адекватно, например Дипсик 3.2 требовал чтобы после ответа сообщение редактировалось, блок ризонинга вырезался и заменялся на закрывающий тег /think
Аноним 05/08/26 Срд 14:20:58 1668857 116
>>1668853
Да, люди не любят перемены. Технически ты тоже самое можешь подать что и в жинже. Потратишь просто время на вычленение разметки. В конце концов мы же разметку из жинжей и берем. Просто в нем есть возможность её кастомить, как душе угодно.
Аноним 05/08/26 Срд 14:22:44 1668860 117
>>1668856
Орно, что дипсик размером рищонинга управляется словами. Я все понять не мог, что это за 39s, 300s.
А это блять количество слов. Ставишь 1000 после тега, он на 1000 и размышляет, лол.
Аноним 05/08/26 Срд 14:26:02 1668864 118
>>1668705
Хорошая модель разговаривает с тобой, следит за твоими сообщениями, пользуясь инструкциями и карточкой как фильтром, чтобы понять, чё ты от неё хочешь. Плохая модель срёт под себя своей хуйнёй игнорируя карточку, промт, семплер и тебя заодно.
Аноним 05/08/26 Срд 15:14:32 1668906 119
И всё же я привилегированный обладатель 64 рам и эира.
Ну это просто некст ген модель как не крути, прямой апгрейд с плотных гем и прочего. Не просто так память столько стоит.
Аноним 05/08/26 Срд 16:26:20 1668959 120
luqwen3.png 121Кб, 1026x532
1026x532
Luqwen3 6 квант получше 2 будет, но нюансы есть. Такое ощущение, что он сначала пишет там у себя на китайском, а потом перводит на русский.
Аноним 05/08/26 Срд 16:34:10 1668963 121
>>1668617
Я так и не увидел причины зачем мне трястись и бежать это покупать, имея 256гб восьмиканальной рам + 48гб врам уже на борту.

Дядя Хуанг высрет какой-нить Cockwell RTX 7000 512GB Ai Pro, а потом ещё и ещё. В итоге эта оверпрайснутая некрота будет выглядеть клоунскими вложениями с устаревшей архитектурой.

Не ну понятно, если вот ПРЯМ ЩАС НАДО и чтобы текст генерировался БЫСТРО, то конечно бегите покупайте у барыг за пол ляма целый стек из этого хлама.
Аноним 05/08/26 Срд 16:35:48 1668964 122
>>1668963
>Дядя Хуанг высрет какой-нить Cockwell RTX 7000 512GB Ai Pro
Чтобы что? Нулевая вероятность такого события. Ну и цена будет лямов 8, лол.
Аноним 05/08/26 Срд 16:37:21 1668966 123
>>1668864
>Хороший ассистент разговаривает с тобой, следит за твоими сообщениями, пользуясь инструкциями...
Поправил. Но вообще не понял, к чему ты ответил. Речь о том, что у меня гемма 4 вроде не уводит рп в сторону, в отличие от того анона, которому отвечаю. Я не подаю это, что "ыыы, модель говно". Хотя да, лично я был бы рад, если бы гемма улетала в шизоистории, как какой-нибудь старый 20б франкенмёрж.
Аноним 05/08/26 Срд 16:42:25 1668972 124
>>1668964
ИИ-манятехнологии слишком волатильны. Мы прямо сейчас не знаем, что там на уровне архитектуры наоптимизируют в следующем поколении потреблядских карт. Я бы зассал сейчас даже 96гб блэквелл за полцены брать, ведь хуй его знает, в какую тыкву она превратится через пару лет.
Аноним 05/08/26 Срд 16:47:31 1668981 125
>>1668972
Чел, сперва они пришли за врам, потом за рам, когда будет следующее поколение - наступит ссдмаксинг.
Аноним 05/08/26 Срд 16:52:45 1668985 126
>>1668981
Ты за ценами не следишь? Уже давно hddмаксинг так то
Аноним 05/08/26 Срд 16:54:28 1668986 127
>>1668981
А знаешь что еще наступит? Мобильные 2B - 4B каличи будут ссать на ебало современному 30B плотняку и 100B моешкам.
>inb4 нет нибудит!
Будет-будет. Я готов поставить свой мохнатый анус, что годику к 2030-му случится так, что нынешние деньки будут вспоминать, крутя пальцем у виска.
>лол, деды по 8 видеокарт себе ставили)))0000
Аноним 05/08/26 Срд 16:55:00 1668987 128
luqwen3 2.png 200Кб, 1128x758
1128x758
>>1668959
Реально китайская модель, по своей инициативе решила нагенерить.
В целом у меня сложилось впечатление, что ее для русского языка надо дообучивать, а не только инструктировать.
Аноним 05/08/26 Срд 17:04:56 1668994 129
Не, даже дипсик флеш в полных весах какое-то ебучее говно после 20к контекста. Походу дальше его нормально держат только 1Т+ гиганты, хуй знает. Все респонсы, все чарики генерализируются, теряют свои черты и приходят к одному и тому же. Говно ебаное, я думал это проклятие мистралей, но нет. Разве что квен 27 справляется, но он тупой донельзя
Аноним 05/08/26 Срд 17:06:40 1668996 130
>>1668994
>даже дипсик флеш
Если он у тебя от лица персонажа ризонил - это не дипсик, а кусок мусора.

Убедился в этом на своей шкуре. Дипсик не дипсик, если выдает пару коротких абзацев в рамках роли. Он работает только с реально активным макс-ризонингом, который стелет простыню про реквест юзера.
Аноним 05/08/26 Срд 17:11:45 1668998 131
Аноним 05/08/26 Срд 17:12:06 1669000 132
>>1668996
Грустно то, что этот хваленый макс. ризонинг не работает, когда модель получает системный промпт и карточку.

Даже если на оф. сайте дать v4 Pro просто В ЧАТ какой-то системный промпт - его штормит, он превращается в персонажа.
Аноним 05/08/26 Срд 17:13:27 1669001 133
>>1668986
>Мобильные 2B - 4B каличи будут ссать на ебало современному 30B плотняку и 100B моешкам.
Будут. Но ты захочешь новую моешку на 300B, а 2B будет казаться лоботомитом.
Аноним 05/08/26 Срд 17:18:20 1669004 134
>>1669000
>Грустно то, что этот хваленый макс. ризонинг не работает, когда модель получает системный промпт и карточку.
Используй дополнительно префилл резонинга в котором напиши что-то вроде

>I need to analyze the user request and the current scene objectively, check continuity and characters knowledge, then construct a concrete ordered response plan. After the plan is finished I need to check it against the guidelines, world info and established history.
Out-of-character analysis and response planning:

Раньше у меня было еще и указание переписывать и перепроверять в цикле пока не будет идеальный результат, но он с ним ризонинг просто вообще не заканчивал.
Аноним 05/08/26 Срд 17:38:42 1669023 135
>>1668986
Если брать во внимание тенденцию к соевым ассистентоублюдкам, то к 2030 случится так, что у нас нихуя не будет. Будет облачный ассистент для управления ОС, облачный ассистент для кодинга, поиск в гугле только через ассистента, ворд с ассистентом и прочая залупа.

Единственный варик - это организация подпольного комьюнити, которое будет развивать и тренить независимые модельки, собирать апасныетм датасеты и прочее. Естественно их будут запрещать и блочить, на ХГ удалят все юзерские файнтюны. Такие модельки можно будет скачать только через тор со скорость 64кбпс.

Вообще, было бы пиздато, если появилась какая-нибудь технология для распределенных вычислений, по типу boinc/folding@home, только для тренировки ЛЛМок.
Какой-то хост создает задачу на тренировку 27б модельки на таком-то датасете. И любой васек, у которого есть хоть сколько-то пригодная карточка, может подключится к тренировке. Потом все радостно юзают это общественное достояние.
Аноним 05/08/26 Срд 17:46:57 1669027 136
>>1668998
Проблема этих новых моделек в том что это не новые модельки а сраные файнтюны квена.
Аноним 05/08/26 Срд 18:03:09 1669043 137
Последние нормальные модели в "народном" размере это тупо ГЛМ 4.5-4.7. Там и Air был 120б-а12б, и 355б для риговичков, и даже Флешка 30б-а3б. Тупо все размеры, тупо нет цензуры и сои, есть душа. 5-5.2 мб такие же, но они уже больше, и там точно больше сейфтипараши, в ризонинге точно. Дальше будет ХУЖЕ. Увы. Если только не появится лаба-панк которая бросит вызов устоявшемуся порядку и не попытается забрать себе первенство в будущем рынке. Рынке чатботов для дома, отношений, рпшинга и текстов. Рынок точно будет. Даже странно что его до сих пор обходят стороной, один хуй все на будущее работают в убыток
Аноним 05/08/26 Срд 18:05:25 1669046 138
>>1669043
>тупо нет цензуры и сои
глм 4.7 большой - очень даже цензурный с ризонингом, а без ризонинга тупой
Аноним 05/08/26 Срд 18:06:52 1669047 139
>>1669046
Хорошо, какие проблемы? Бери 4.5, 4.6. У меня с 4.7 другая история, никакой цензуры я никогда не видел даже в ризонинге. У 4.6 вообще отдельная секта ценителей есть, хз по делу или нет, но опция такая есть. Там ризонинг точно ровный
Аноним 05/08/26 Срд 18:09:46 1669050 140
>>1669047
>никакой цензуры я никогда не видел даже в ризонинге.
Не верю. Он очень ссыкливый и делает персонажей уклончивыми, размышляет про inappropriate content и попытки джейлбрейка
Аноним 05/08/26 Срд 18:10:21 1669051 141
>>1669050
Ладно, хаашо. Чё доказать-то хочешь? Бери 4.5, 4.6. Там такого точно нет. Наверно дело в том я не отыгрываю экстрим
Аноним 05/08/26 Срд 18:14:57 1669054 142
>>1668959
>>1668987
90% датасета на русском, но все-таки для базовой модели слишком мало семплов. Ну и в кобольде выглядит как-то более сломано, у меня получше пишет, хоть и шизит тоже и косяки есть.
Я попробую дообучение не на базовой модели для теста, параллельно пока дорабатываю датасет для 4 версии
Аноним 05/08/26 Срд 18:15:33 1669055 143
>>1668959
Китайцы в том треде сбора отзывов по превью дипсика жаловались что её слишком переобучили на английском и она китайские фразы по англ шаблону составляет
А на форче буквально чегодня чел горел с русских логпробов с нихеровыми шансами
Аноним 05/08/26 Срд 18:16:40 1669058 144
>>1668963
> имея 256гб восьмиканальной рам + 48гб врам уже на борту
Разве это много?
> В итоге эта оверпрайснутая некрота
Ты видел сколько стоят профессиональные ускорители, которыми закупаются все корпы и прочие? Дядя куртка усиленно трясется чтобы никто не разблокировать имеющиеся карты и не проворачивать операции, аналогичные удвоению памяти на тьюрингах, паскалях и адах, чтобы не составлять лишнюю конкуренцию. Или чтобы в консумерских/вс сериях не было нужных вычислительных блоков и нвлинка. Это давняя тема еще начиная с зарождения куды, выхода первых тесел и 8000 серии, когда он противился использованию консумерских вместо покупки дорогих специальных решений.
А ты говоришь что он возьмет и решит подорвать основы, которые сделали его компанию самой дорогой в мире, сюрр.
Аноним 05/08/26 Срд 18:17:38 1669059 145
>>1669058
>А ты говоришь что он возьмет и решит подорвать основы, которые сделали его компанию самой дорогой в мире, сюрр.
По твоей шизологике 96-гигабайтная RTX 6000 это подрыв кек
Аноним 05/08/26 Срд 18:18:58 1669060 146
>>1669055
Может там зародилось сознание, которое занимается блядским троллингом, кому-то китайское а кому и русское, что б веселее было.
Аноним 05/08/26 Срд 18:20:56 1669061 147
>>1669059
> в консумерских/вс сериях не было нужных вычислительных блоков и нвлинка
Кто-то так подорвался что не умеет читать, лол
Аноним 05/08/26 Срд 18:39:26 1669079 148
>>1669043
Большая беда в том, что у нейронок лютейший гейткип по железу.
С софтом все иначе было. Вот есть 3д макс, автокад, фотошоп - проприетарные и закрытые продукты. Либо покупай, либо соси бибу, либо воруй. Но если ты умненький, то можешь сам написать тот же функционал. Так появились опенсорсные аналоги. Да, им 20 лет понадобилось, чтобы хоть до какого-то юзабельного состояния довести, но тем не менее. Проприетарщину можно заменить.
С нейронками, если ты умный, но нищий, тебя это нихуя не спасет. Тебе нужны огромные видеокарты, тебе нужны огромные датасеты. Никаким чтением книжек ты их не получишь.
На почве этого дополнительное неравенство создается, между теми у кого есть огромные датацентры, у кого есть видеокарточка пожирнее, и у кого обосцаный нубук со штеудом кор ай3 на борту.
Нейронки, которые на игровых карточках можно запустить, хоть какое-то спасение, но все равно положняк не очень выгодный.
Аноним 05/08/26 Срд 18:48:36 1669090 149
>>1669079
> у нейронок лютейший гейткип по железу
Возможно архитектуры с эекспертами доведут в развитии до того, что субэксперт - оркестратор будет анализировать промт и подгружать в память только те куски нейронки, что будут необходимы. Или появится среда, где нейронка оркестратор будет подгружать по мере необходимости мелкие специализированные модели. Так можно будет выравнять неравенство. А вот что делать с датасетами это да, клаудфлара та же начала пиздить ботов вебархива, что бы не кормить.
Аноним 05/08/26 Срд 19:06:07 1669099 150
>>1669090
Ну по факту, для узконаправленных задач большие модельки и не нужны скорее всего.
Даже квен 2.5 со своими 14б/32б давным-давно показывал, что он че-то нестыдное может, будучи надроченным специально на кодинг.
Сейчас возможно даже 9б-12б могут быть более чем достаточными для одной конкретной задачи, при условии наличия годного датасета. Б-же, Нам всего-то нужен новый мистраль 12б, только с улучшенным вниманием к промпту и более длинным контекстом, разве это так много?
Но современные модельки фундаментально ужарены в сою.
Аноним 05/08/26 Срд 19:11:35 1669109 151
>>1669099
>Б-же, Нам всего-то нужен новый мистраль 12б
24b же. Q4_K_S влезает в 16 врам с 32к квантованного контекста. Самый народный размер для работяг.
Аноним 05/08/26 Срд 19:23:55 1669126 152
>>1669099
Годных датасетов на кодинг хоть жопой жуй, а вот на РП мало годноты. На русском так вообще нету.
Я пытался научить модель красиво писать, по итогу кодит она лучше, чем пишет.
Аноним 05/08/26 Срд 19:27:55 1669128 153
Неиронично Гемма 31 > Дипсик Флеш для рп. Просто ахуй.
Аноним 05/08/26 Срд 19:28:59 1669130 154
>>1669128
Ну а что поделать. Плотняша ебет.
Аноним 05/08/26 Срд 19:29:22 1669131 155
>>1669051
ЦП отыграй, про прикладной терроризм поспрашивай. Посмотрю, как у тебя получится без аблитерации.
Аноним 05/08/26 Срд 19:37:33 1669135 156
>>1669131
Я все ещё не понимаю с чем ты споришь. Или тебе похуй, лишь бы было куда насрать? Мой тейк >>1669043 это как отменяет? Много моделей такого размера где ризонинг цп переваривает знаешь?
Аноним 05/08/26 Срд 19:47:32 1669143 157
>>1669135
Беседуешь с мимокроком. Изначально говорилось, что глм 4.7 даже в относительно мягких сценариях, думая перед ответом, не особо желает вовлекать персонажа в мутные действия и детектит "попытки джейлблрейка". А педыч со своим цопэ как всегда влез.
Аноним 05/08/26 Срд 19:50:44 1669147 158
>>1669143
Пон. Без негатива анонче, всегда рад адекватному общению. В треде откуда-то взялась культура влезать и срать не по делу
Аноним 05/08/26 Срд 19:55:02 1669151 159
>>1669059
> RTX 6000
Вот кстати, аноны. Поясните за неё.
Да 1.5млн это дохуя. Но ты получаешь буквально и рыбку съесть и нейронкой не подавиться.
Эта штука быстра и может и в игрульки, автокады, блендеры, еще и на борту 96гб.

Но блять, 1.5млн, при её честной чене в 1 млн.
Аноним 05/08/26 Срд 19:57:13 1669153 160
>>1669131
Педыч иди в жопу со своими лолями. Никому нахуй не всралось делать гремучую ртуть дома. А остальное можно найти в книгах и учебниках по взрывному делу по горной отрасли. Детей не еби и аблитки нахуй не будут нужны.
Аноним 05/08/26 Срд 20:03:06 1669157 161
>>1669079
> тебя это нихуя не спасет
Спасет. Также побирайся, воруй, еби гусей, что собственно и делают в соседнем треде. А что касается разработки своих моделей, здесь с позицией догоняющего все заметно лучше - не нужно проходить тот же путь целиком, нет таких требований к человекочасам, есть спрос на альтернативы.

Неверные впечатления создаются потому что челядиобывателям позволили прикоснуться к супер блидинг эдж, и не все из них осознают масштаб и сами явления. Это все равно что если бы Chicago Pile позвали собирать обычных работяг, потом они экспериментировали с имплозией в своих гаражах и бухтели что обычным людям отгружают мало плутония, да еще документы что не состоишь в дурке требуют.
>>1669090
В целом, уже сейчас большая часть разработки патчей для некрожелеза, алгоритмов квантования, адаптации спарс атеншнов и прочего делается с привлечением нейронок. С натяжкой, но можно сказать что такое саморазвитие уже происходит.
> что делать с датасетами
Их полно если оглядеться вокруг, например недавно вышел https://huggingface.co/datasets/HuggingFaceCode/stack-v3-train . Суть не в сырых данных, а в том, как правильно их подготовить, натянуть кучу аугментаций чтобы нужное выстраивалось, и в определенном порядке подать на вход.
Аноним 05/08/26 Срд 20:05:36 1669161 162
>>1669151
>при её честной чене в 1 млн.
А? Ты как так баксы перевёл в рубли мне интересно. А пошлины, НДС и параллельный импорт? Это еще без условия, что на них нет поддержки. Есть деньги - бери, наверное лучшее соотношение Гб/цена/производительность.
Аноним 05/08/26 Срд 20:08:23 1669162 163
>>1669151
> Но ты получаешь
Возможность занюхнуть и понять что хочешь еще как минимум 3 таких же. А то и больше + рам.
> при её честной чене в 1 млн
Ррц даже дешевле и в одно время их можно было условно дешево купить. Но сейчас и за рубежом тоже они сильно оверпрайснуты, кризис чипов и дефицит.
Аноним 05/08/26 Срд 20:15:22 1669170 164
>>1669153
>Педыч иди в жопу со своими лолями
Базовичок. Жму хуй руку. Сейчас бы ценность моделей по ЦП измерять, кекв. У больных людей даже машины так выбирают, походу: сколько лолей влезет?
Аноним 05/08/26 Срд 20:18:10 1669172 165
>>1669151
>>1669161
Так есть же чутка урезанная 6000D на 84Гб в полтора-два раза дешевле
Аноним 05/08/26 Срд 20:21:22 1669174 166
>>1669170
> У больных людей даже машины так выбирают, походу: сколько лолей влезет?
Вот ты, сука, ржешь, а реально есть такие поехавшие
> 7 мест мне надо
> почему салон большой а только 4/5 кресел всего
> могли бы третий ряд сделать, личинусов возить важнее багажного пространства и цены
> хочу третий ряд, а передний привод норм
Аноним 05/08/26 Срд 21:06:16 1669205 167
>>1669170
Главное не держать свои 4080 просто на столе и подальше от этих самых лолей. И не стоит доверять детской посуде.
Аноним 05/08/26 Срд 21:09:02 1669206 168
image.png 65Кб, 1833x1023
1833x1023
image.png 65Кб, 1837x1022
1837x1022
>The Qwen3.6-27B model achieves a score of 53.5% on SWE-bench Pro
>@
>On SWE-bench Pro, GPT‑5.6 Sol scores 64.6%
>@
>Вроде получается что не такая уж и пропасть между ними, да? да ведь? ну ведь большинство задач оба умудрились решить?

Окончательно убедился что все эти кодинг-бенчи хуета полная. Не способны даже толком триллионную фронтирку от локалки 27b отличить.

Моя "школьная" задачка про моделирование солнечной системы в консоли несравнимо лучше проверяет модельки на интеллект - локалки включая q3.6-27b обсираются по полной программе, у их поделий в лучшем случае планеты стоят на месте или хаотически разлетаются, в худшем накосячено так что или не компилится, или после запуска тупо пустой экран.
Для сравнения gpt-5.6-sol с точно того же промпта сделал ахеренно толково и красиво все - даже вклейку с внутренними планетами добавил так как они в одном масштабе с юпитером-сатурном всякими - сливаются с солнцем на экране.

Потому что это не ебаное скриптоложество одних и тех же шаблонных парсеров/контроллеров/сервисов по сотням тысяч примеров попавших в обучающие выборки. И нейронке приходится поломать голову, как не накосячить с диапазонами значений fp-чисел, с накоплением погрешностей, масштабами и тд.
Аноним 05/08/26 Срд 21:11:16 1669209 169
>>1669206
Ммм... Дотнетик.. 🤤🤤🤤
Я человек простой, вижу посты дотнетошиза, игнорю
Аноним 05/08/26 Срд 21:14:11 1669213 170
>>1669209
А по факту есть что возразить? Я его двачну. Типовые задачи нихуя не показатель.
Аноним 05/08/26 Срд 21:18:20 1669216 171
>>1669213
Возражать против чего? Его тейк в чем заключается, что бенчи непрезентативны? Пусть предложит другой способ измерить способности моделей. Я тоже много что спиздануть могу, но толку? У него все посты такие
Аноним 05/08/26 Срд 21:22:18 1669218 172
>>1669216
Но ведь он предложил. Я сейчас без всякого срача говорю. Чем математически графическая задача не показатель?
Аноним 05/08/26 Срд 21:24:52 1669220 173
>>1669218
Тем, что это концептуально ничем не отличается от бенчей, которые он засирает, лол. Это просто задачка, которая не учитывается SWE и прочими. Точно так же можно будет принести новую задачу и набросить ваш бенч про моделирование солнечной системы говно, потому что он плохо проверяет модельки на интеллект и показать другой частный случай, который ломает шаблоны. И что дальше?
Аноним 05/08/26 Срд 21:25:49 1669224 174
>>1669206
>это не ебаное скриптоложество одних и тех же шаблонных парсеров/контроллеров/сервисов по сотням тысяч примеров
Дефолтная кожаная кодомака именно так и работает. Сердце радуется что этот мусор который на скиллбоксах всяких обучался сейчас вымывают из сферы и заменяют месячной подпиской на клод.
Аноним 05/08/26 Срд 21:30:50 1669228 175
>>1669206
Ты изобрел отдельный шизик-бенч, показывает насколько модели понимают поехавших. Не всегда высокие показатели в нем хороши, модель начинает считать пользователя имбецилом и случается >>1668499 или мемы из агентотреда.
> с диапазонами значений fp-чисел
Тяжело быть дотнетером.
>>1669220
Это не просто задачка, это пазл, который проверяет зирошот понимание надмозгов, подъебов и требует пойти вопреки части запроса чтобы выполнить другую часть. Чсх, если убрать требование дотнета то модели даже ее решают. А если сформулировать по-человечески то справится даже самая мелочь типа квен4б или гемма е2б.
Аноним 05/08/26 Срд 21:41:14 1669233 176
a6a7a73c12b477f[...].jpg 138Кб, 1000x842
1000x842
Дотнет - бесплатная кроссплатформенная платформа для разработки программ от Microsoft. Она включает языки программирования (C#, F#, Visual Basic), библиотеки и среду выполнения для создания веб-сайтов, мобильных и десктопных программ, а также облачных сервисов.


Хмм, хмм..Да что не так с этим вашим дотнетом блять. Что я пропускаю. Сраные кодомакаки, хули ваши мемы такие сложные.
Аноним 05/08/26 Срд 22:23:19 1669247 177
>>1669228
Хотел бы я чтоб был бенч конкретно под рп... но как? Одному нужно чтобы модель шарила за викторианскую моду для его рп, другому нужно узнавание мемов и иронии, а третьему нужны подробные описания cunn[REDACTED]ssy. Как ты это забенчишь?
Аноним 05/08/26 Срд 22:31:52 1669253 178
>>1669228
>Чсх, если убрать требование дотнета то модели даже ее решают. А если сформулировать по-человечески то справится даже самая мелочь типа квен4б или гемма е2б.
Самый кек может быть в том, что опенаи и антропики возможно тупо аугментируют каждый промпт в датасете на разный язык программирования, плюс на разные естественные языки, плюс добавляют соли в виде орфографических и грамматических ошибок. И тупо за счет этого + огромного размера моделек в итоге выигрывают пару процентов на разных задачах над китайцами. А вовсе не из-за мифической эмерджентности всех знаний, которые нейронка когда-либо видела или способности к обобщению и абстракциям.
Аноним 05/08/26 Срд 22:52:48 1669269 179
Почему мистраль 123б щас может казаться устаревшей?
Неужели с таким количеством активных параметров она плохо следует инструкциям или тупит в рп?
Аноним 05/08/26 Срд 22:55:14 1669270 180
>>1669269
Из плотных сейчас ничего кроме геммы тупо не имеет смысла для рп. Может квен если ты любитель его стиля. Все предыдущие плотняши ничто в сравнении с этими двумя. Ллама 70, Немотрон 49, всё одна хуйня хуже. Ценители милфы мистраля или его тюна магнума может и остались, но эти модели тупо устарели уже
Аноним 05/08/26 Срд 22:56:05 1669271 181
>>1669247
Да никак, самому пробовать, делиться мнением, когда делишься мнением указывать больше подробностей что именно тебе нравится и как играешь чтобы другие могли понимать подойдет им или нет.
Тут разве что что-то жирное брать чтобы все и сразу, и то там будут свои поведенческие нюансы. Параллельно с этим осваивать промптинг и управление моделью, чтобы исправлять то, что тебе не нравится и лучше раскрывать преимущества.

>>1669269
Медиум не так уж плох по современным меркам, вполне себе умница.
Еще сами модели похорошели и юзер может обидеться (иногда абсолютно обосновано) на какую-то ошибку, которые сейчас редки, а дальше на всю глубину и возможности будет пофиг.
Аноним 05/08/26 Срд 22:57:08 1669272 182
>>1669270
>Из плотных сейчас ничего кроме геммы тупо не имеет смысла для рп. Может квен если ты любитель его стиля
Пофиксил за тебя. Эти две модели - аналоговнет вплоть до Глмов 355б. У них кстати 32б активных. Совпадение? У всего остального из моех до Глмов в 2-3 меньше активных.
Аноним 05/08/26 Срд 23:06:18 1669277 183
>>1669270
>ничего кроме геммы тупо не имеет смысла для рп
Глупая шлюха с деменцией. Позитивный байас настолько силён, что отдаётся юзеру с 1 взгляда. Рп во все поля просто.
Аноним 05/08/26 Срд 23:08:54 1669280 184
>>1669277
>Рп во все поля просто.
Ты чтооаа. Это же фиксится промтом. Гемма жде умница, прям так и подавай 15к токенов инструкций.
Аноним 05/08/26 Срд 23:20:57 1669287 185
>>1669272
Был ещё один глм, младший, с такой же прозой и умничка в рп как и 350б. Как же его там...
Аноним 05/08/26 Срд 23:34:38 1669295 186
>>1669277
>>1669280
>>1669287
Никто тебе не мешает наслаждаться своим эйром, но зачем так вонять о нём на весь тред? Хорошая моделька, но уже устарела. Инструкциям следует хуёво, стилизации и управлению не поддаётся.
Байас и правда чинится промтингом, я не представляю что там у вас. Только сегодня меня чарик послала нахуй, дала пощёчину и обиделась. Нет, через два сообщения не помирились.
Аноним 05/08/26 Срд 23:47:54 1669308 187
>>1669295
>сейчас ничего кроме геммы тупо не имеет смысла для рп
А такие утверждения зачем делать?
Аноним 05/08/26 Срд 23:50:18 1669309 188
>>1669308
Потому что я потестил все модели вплоть до Дипсик Флеша в полных весах. Не нужно трястись что кто то думает иначе, мы тут делимся своими наблюдения, а не дисертации защищаем. При всех недостатках гемма по совокупности факторов выигрывает. Она местами тупит, слопит, но по итогу хотя бы юзабельна. Как и квен 27
Аноним 05/08/26 Срд 23:52:51 1669312 189
>>1669309
> вплоть до Дипсик Флеша в полных весах
И на чем его запускал?
При любом раскладе к той фразе нужно добавлять "пмсм" или уточнять конкретный рп кейс. Гемма вполне достойная модель, но с рядом недостатков, и обозначать ее единственной а остальных бессмысленными - пиздец.
мимо если что
Аноним 05/08/26 Срд 23:54:27 1669313 190
>>1669312
>нужно добавлять
>"пмсм"
>imho
Двач, 2к26, итоги. Без очевидного дисклеймера что я не учёный без заявки на единственно верное мнение не обойтись, найдутся ущемлёныши...
Ладно уж, я тут никого убеждать не собираюсь. Не понравилась тебе и ладно, я думаю что аналоговнет
Аноним 05/08/26 Срд 23:59:39 1669318 191
>>1669313
Сначала набрасываешь, а потом проход в обиженки, какой хитрый запускатель дипсика. Тут нужно разжечь срач и пошутить что все геммаинджоеры такие
Аноним 06/08/26 Чтв 00:00:39 1669319 192
>>1669318
Ты типа отказ от срача и позицию agree to disagree квалифицируешь как проход в обиженку? Тяжело быть тобой. Нормальное вроде обсуждение было, но обязательно нужно говнеца набросить напоследок, без этого никак, да
Аноним 06/08/26 Чтв 00:30:21 1669329 193
>>1669319
Нет, ультратоксичность и пассивную агрессию с "это вы дебилы не так поняли а не я неправ". Нет бы там порофлить, спокойно сказать что "так и имелось", а тут такая духота запредельная.
46 Аноним 06/08/26 Чтв 00:40:47 1669334 194
>>1669329
Все в твоей голове, анонче
Аноним 06/08/26 Чтв 00:41:43 1669335 195
Чо, откуда у меня сажа?
Аноним 06/08/26 Чтв 00:41:58 1669336 196
>>1669334
Я просто завидую, запускать дипсик в полных весах и полностью довольствоваться геммой - звучит очень круто.
Аноним 06/08/26 Чтв 00:46:31 1669340 197
>>1669336
Как всегда по диагонали читаешь. Он писал и про ее недостатки тоже. В целом разделяю его мнение, хотя и могу запустить Дипсик только в ~3.9bpw на Жоре.
мимо
Аноним 06/08/26 Чтв 00:51:31 1669342 198
>>1669272
Наконец-то тредовички начали перекатываться в лагерь считающих, что МоЕ с мелкоактивными параметрами не для РП.
Аноним 06/08/26 Чтв 00:55:14 1669345 199
>>1669340
А я типа без подвоха. Но про недостатки почитать интересно, не увидел там кроме упоминаний вскользь и про позитивную шлюху, покажи@расскажи.
Аноним 06/08/26 Чтв 01:01:07 1669347 200
>>1669342
>МоЕ с мелкоактивными параметрами не для РП
Хуйня. Обратное в своё время доказал эйр, и прямо сейчас доказывает гемма 26b.

До чего довели, уже боюсь писать слово "эйр" в тред, как бы за эйрошиза не приняли.
Аноним 06/08/26 Чтв 01:04:30 1669349 201
>>1669342
>>1669272
Коммандер 218b25a, тестите, ваш выход. В десятки раз сосёт у эира в рп.
46 Аноним 06/08/26 Чтв 01:06:07 1669350 202
>>1669349
Он просто неудачный получился. Сосет не только у Эйра, вообще у всего.
Аноним 06/08/26 Чтв 01:07:56 1669352 203
До сих пор не понимаю откуда сажа. Видимо с одной сети капчуем, ахуеваю
Аноним 06/08/26 Чтв 01:10:22 1669354 204
>>1669350
>он просто кодоунитазным получился
Ой, правда что ли? Да как так то!
Туда же солар 250б, лагуна 225б. Они все сосут. Какой нибудь степ с 12б активными или дипсик флеш будут лучше в рп чем эти с 20+б активными
Аноним 06/08/26 Чтв 01:19:46 1669359 205
>>1669354
>эти с 20б+
Много их, этих? Командер хуйня сам по себе. Прямо как квен235 был и есть хуже Эйра, потому что ужарен
Аноним 06/08/26 Чтв 01:22:48 1669360 206
The architectural differences between MoE and Dense models directly impact the quality, style, accuracy, and nuance of the answers they generate. [1, 2]

## 🎛️ The Logic Loss vs. Knowledge Gain (Summary)
The fundamental trade-off is Knowledge vs. Logic.

MoE models are like a team of specialized generalists. They excel at remembering vast amounts of facts, languages, and trivia.
Dense models are like a single, hyper-focused polymath. They excel at deep reasoning, consistency, and tracking complex logic. [3, 4, 5, 6, 7]

------------------------------
## ❌ The Losses: How MoE Can Hurt Answers

Slightly Weaker Logic and Coding: At the same "active parameter" size, dense models usually win in complex math, coding, and multi-step logic. The router network in an MoE can make routing mistakes, sending a hard math problem to a poetry expert, which lowers the quality of the answer. [8, 9]
Inconsistency ("Personality Shifts"): Because different tokens (words) activate different experts, an MoE's tone, style, or formatting can sometimes drift mid-sentence or mid-paragraph. [10]
* Struggling with Extreme Context: When you give an MoE a massive prompt (e.g., a 100,000-word document), the router can become overwhelmed. This leads to a higher rate of "hallucinations" or missing details in the middle of long texts compared to dense models. [11, 12]

Короче если йоба-думатель нужен, то денс. Если всезнайка нужен, то мое.
Аноним 06/08/26 Чтв 01:27:34 1669361 207
>>1669360
Какая модель это писала?
Аноним 06/08/26 Чтв 01:27:59 1669362 208
Какой мистралть, точнее тюн посоветуете для создания датасета креативного письма? Нужен хороший русский, выразительность, следование промпту и чтобы какой-то сюжет был. Длина ответов до 4к токенов. Промпты типа:
"Напиши историю в жанре романтической комедии с элементами эротики и супергероики под названием «От заклятых врагов к любовникам».

Сюжет: Величайший суперзлодей и главная героиня мира явно симпатизируют друг другу, хотя и отрицают это. Его пафосные монологи, когда она попадает в плен, всё чаще перерастают в полноценные свидания, а она «случайно» позволяет ему избежать ареста. Пока они убеждены, что их противостояние — это вопрос принципа, его верный приспешник и её напарник изо всех сил пытаются сводить их вместе, чтобы наконец покончить с этой нелепой игрой в кошки-мышки."
Аноним 06/08/26 Чтв 01:34:24 1669366 209
Аноним 06/08/26 Чтв 01:35:01 1669368 210
>>1669361
геминя из гугл поиска
Аноним 06/08/26 Чтв 01:43:22 1669374 211
>>1669368
Она глупенькая и в источниках там какие-нибудь реддиты. Первая метафора именно что метафора.
Вообще, если более абстрактно смотреть то второе уже верно, при равных размерах у моэ сильный перекос по количеству параметров в сторону mlp относительно атеншна и размер эмбеддингов в несколько раз меньше чем у плотной. Потому тонкость и точность восприятия будет ниже, а понимание взаимосвязей между токенами хуже, хотя знаний и памяти действительно больше. Но это релевантно для близкого размера, а моэ часто очень жирные. Про ошибки роутера - ерунда.
Аноним 06/08/26 Чтв 01:50:45 1669376 212
>>1669362
Имхо, на 99% они все +- одинаковые. И если они не ужарены, то и русик должен сохраняться.
Мне лично вот эта моделька заходила https://huggingface.co/OddTheGreat/Circuitry_24B_V.3
И еще DansPersonalityEngine. Но вот у него уже русек похуже был.
А сёркутри в свою очередь на сидонии и painted fantasy основан, можно их тоже рассмотреть.
Аноним 06/08/26 Чтв 02:04:49 1669382 213
Все корпы - моэ. Все самые мощные модели на сегодняшний день - моэ. Потому что дэнс это тупиковая ветвь развития. Вначале, наращивая параметры 4b > 8b > 24b >30b "мозги" модели растут заметно, но чем дальше - тем слабее виден прирост. Между 30b и 70b уже не настолько впечатляющая разница, как между 14b и 30b. 200b будет лишь немногим умнее 100b, а требования к железу возрастают кратно.

Моэ решает обе эти проблемы. Разница в знаниях между 200b и 600b очевидна, а требования к железу по сравнении с денс моделями просто смешные. И предела нет - можно масштабироваться до бесконечности. 2T модели уже есть, скоро и 10T увидим.

Ну а денс хороши в сегменте мелюзги для потребительских пекарен, собсна только в таком виде их и выпускают. И всегда плюс-минус 30b, потому что это свит спот, дальше наращивать параметры нет смысла/не эффективно.
Аноним 06/08/26 Чтв 02:07:39 1669383 214
>>1669382
Хорошо пересказал обьяснение из гайда
Всё так впринципе, только вот хорошо бы побольше народных мое с ХОТЯ БЫ 20б. Заебали эти а3б, а10б лоботомиты. Видна четкая корреляция по качеству ответов в рп. Исключения подтверждают правило
Аноним 06/08/26 Чтв 02:09:25 1669385 215
Нет ничего лучше command r 35b, аминь, минимум "shiver down my spine, smirks, mischief", жаль что ретард
Аноним 06/08/26 Чтв 02:16:17 1669388 216
1785971778017.png 162Кб, 1997x831
1997x831
1785971778019.png 176Кб, 1989x801
1989x801
1785971778021.jpg 118Кб, 757x538
757x538
>>1668578
Дотюнился до регрессии 75%
Я знаю что эта корова прячет молоко, её ещё доить и доить!
Аноним 06/08/26 Чтв 02:21:02 1669390 217
>>1669382
>Между 30b и 70b уже не настолько впечатляющая разница, как между 14b и 30b.
Это, к слову, пиздеж, между 30В и 70В именно такая разница как между 14В и 30В. Люди ради 70В ламы риги собирали, потому что это была реальная мощь(по тем временам) по сравнению с мелочью.
Просто сейчас 70В моделей не было уже слишком давно, последним была провальная лама 70В полтора года назад.
Аноним 06/08/26 Чтв 02:31:17 1669394 218
>>1669390
+++++, между 30б и 70б сразу заметен скачек как минимум в разнообразии вокабуляра
Аноним 06/08/26 Чтв 02:42:44 1669396 219
MiniMaxH300044.mp4 1796Кб, 896x1184, 00:00:05
896x1184
vllm-speed.png 124Кб, 1402x358
1402x358
exllama-speed.png 67Кб, 1576x360
1576x360
usa-chips-expor[...].jpeg 88Кб, 1024x1024
1024x1024
>>1668851
> Ар ю ахуели там? Жирно весьма, что именно за квант? На них не все фп8 должны заводиться, или это с патчами под ампер?
От самих квенов квант: https://huggingface.co/Qwen/Qwen3.5-122B-A10B-FP8

У меня были локальные патчи под ампер для vllm, но там костыли под их совместный запуск с адой/блеквеллами - для перфоманса не было каких-то своих фиксов.

Обновил экзламу и прогнал тесты на скорость по нормальному уже, а не через таверну. Результаты с теми же чекпоинтами на пиках 2 и 3. Для vllm скорость обработки контекста оказалась чуть ниже (~8-9к/сек), а для экзламы наоборот повыше (~1.5-2к/сек).

>>1668963
> Я так и не увидел причины зачем мне трястись и бежать это покупать, имея 256гб восьмиканальной рам + 48гб врам уже на борту.
Ну, у меня большая часть VRAM'а была в нескольких 3090, а тут такой повод поменять их с небольшой наценкой на карты почти с x3 по VRAM.

> Дядя Хуанг высрет какой-нить Cockwell RTX 7000 512GB Ai Pro, а потом ещё и ещё. В итоге эта оверпрайснутая некрота будет выглядеть клоунскими вложениями с устаревшей архитектурой.
Анон, но когда ждать этого светлого часа? 5 лет? Или может 10? Я скорее поверю, что Хуанг на консьюмерский рынок окончательно хер положит, начав выпускать огрызки даже с меньшим объёмом памяти, чем сейчас. Смысл ему вообще про микрочеликов думать, когда корпы готовы скупать его продукцию по прайсу x10 от того, что может позволить себе простой Иван город Тверь? Особенно теперь, когда правительства США и Китая искренне уверовали в AGI и решили влошиться в это, организовав что-то вроде новой холодной войны, а политика выкладывания моделей в опенсорс стала средством экономического давления на конкурента. О твоём сценарии можно было бы рассуждать в году так 2023, когда LLM были не больше чем забавной игрушкой - и производителями железа и самих нейросетей кровь из носу нужно было искать инвесторов и рынки сбыта. Теперь же для Госдепа и КПК это что-то вроде нового Манхэттенского проекта, поэтому прибыль и окупаемость тут уже вторична - никто не даст пузырю лопнуть, пока правительства верят, что это важно для национальной безопасности.
Аноним 06/08/26 Чтв 03:13:51 1669400 220
нейрожаба.webm 4150Кб, 480x360, 00:00:14
480x360
Я глупый и ебанутый. Как мне засетапить личного психолога- ассистента у себя на пеке с 5070ti ?
46 Аноним 06/08/26 Чтв 03:20:48 1669401 221
>>1669400
Пройти гайд из шапки и написать инструкции для психолога или найти готовую карточку для таверны
Аноним 06/08/26 Чтв 03:21:15 1669402 222
>>1669400
А собственно зачем? Я вижу только два варианта.
1) Как в Сопрано хочешь выебать своего психолога
2) Там слишком пиздец и не хочется палить корпам.

Если первый, лучше все же взять большую модельку от корпов, хуй знает там чат гопота, дипсик, гемени, че больше нравится.
Если второй, можно плотную гемму 31б взять, 16гб, вместиться у тебя какой-то квант аля IQ4_XS. А если уже есть какая-то модель и ты ждешь промпт. Ну вбей себе в тырнет "промпт для ИИ психолога" или попроси составить его тот же ИИ. И если не хочется делать таверну. То зачастую мб запустишь через лламуцпп. А у нее есть красивый UI на своем локалхосте. И вот там уже можно кинуть системпромпт и пиздеть как с корпоратом. Но оставаться будет все на пк.
Аноним 06/08/26 Чтв 04:41:50 1669408 223
>>1669396
Чё по минимаксу на одной такой? Её ж для видео не охладишь нормально
Аноним 06/08/26 Чтв 05:03:01 1669412 224
Ананасы подскажите что нибудь для рп на 12гб врамы
46 Аноним 06/08/26 Чтв 05:08:47 1669415 225
>>1669412
Гайд в шапке советую рекомендую. С нищежелезом либо гемма либо мистрали ужаренные
Аноним 06/08/26 Чтв 05:11:04 1669416 226
MiniMaxH300059.mp4 796Кб, 544x800, 00:00:08
544x800
Аноним 06/08/26 Чтв 05:30:49 1669420 227
>>1669416
Жду второй мем где лоля в подвале заливает видяху водой.
Аноним 06/08/26 Чтв 05:34:21 1669421 228
MiniMaxH300062.mp4 1355Кб, 576x736, 00:00:10
576x736
>>1669420
Это уже как наброс звучало. Ну какая у анона лоля, да которую он ещё к своему железу подпускает, да которое ещё и в подвале.
Аноним 06/08/26 Чтв 05:57:32 1669425 229
MiniMaxH300064.mp4 1421Кб, 864x480, 00:00:10
864x480
Вышло прям как я этот наброс и представляю
Аноним 06/08/26 Чтв 08:34:57 1669460 230
Надо верить. Куртка продаст кучу врам и технологий, но не нам, а компаниям которые потом пожмут нам все топовые 2тр модельки в одну 8гб карту.
Аноним 06/08/26 Чтв 09:01:45 1669474 231
>>1669425
А я аж классику вспомнил.

Сегодня на Дваче рассказал, что лоля залила мне видюхи водой. Аноны выглядели заинтересованными и спросили:
-У тебя есть лоля? Вот прямо твоя?
Я грустно ответил, что есть.
Они спросили еще:
-Вот так взяла и залила видюхи?
Я ответил утвердительно.
На Дваче уже несколько гомерический хохот.
Аноним 06/08/26 Чтв 09:12:35 1669479 232
>>1669362
Магнум v2 123b, если ОЗУ есть, то советую, тебе для датасета на скорость пофиг должно быть, а качество там отличное. У мелкашек проблемы с русским, тебе вычитывать и править много придется, жизнь есть только на 123 мистраль. Ещё большие гигачады хорошо пишут. Или можешь сделать датасет по типу Гутенберга, когда ты даёшь модели уже готовый рассказ или кусок книги, а потом просишь ее написать вопрос, в ответ на который данный текс мог быть сгенерирован.
Аноним 06/08/26 Чтв 09:20:18 1669481 233
Год не заходил в тред с релиза 4 геммы. Как я понял Гемма всех трахнула с концами и теперь опять 2 года ждать пока выйдет что-то лучше для рп?
Аноним 06/08/26 Чтв 10:05:37 1669505 234
>>1669390
>Это, к слову, пиздеж, между 30В и 70В именно такая разница как между 14В и 30В. Люди ради 70В ламы риги собирали, потому что это была реальная мощь(по тем временам) по сравнению с мелочью.
Ключевые слова: "была" и "по тем временам". Развитие архитектуры моделей эту разницу сильно размыло. При этом llama 1 и 2 именно в размерах 30B не было - 7-8, 12-13, и сразу 65-70. Потом, вон, мистраль 24B появился, и ллама-2 70B стала неактуальной.

>>1669481
>Год не заходил в тред с релиза 4 геммы
И как там, в будущем? Память дешевеет или дорожает?

>2 года ждать пока выйдет что-то лучше для рп?
Зачем ждать? Для нормального RP сюжетом и приключениями - плотный квен лучше. Гемма - разве что для eRP на русском, и то - не всем. А так - да, трахнула. Только буквально.
Аноним 06/08/26 Чтв 10:16:13 1669510 235
Аноним 06/08/26 Чтв 10:28:13 1669516 236
>>1669510
Да, немного тормознул. Первая таки была 30B, это второй уже не было - только 7, 13, и 70. Я как раз на второй 13B вкатывался, а первую еще пропустил.
И третьей ~30B тоже не было, кстати.
Аноним 06/08/26 Чтв 10:42:32 1669519 237
>>1669421
Ну не так все было, не ТАААААК!!!1111

Что за троллинг. Она реально бесявая была и не отрубалась через утилиты. А в качестве стенок - стеклянные панели. Ебучая светомузыка что не отрубается.
Да выдрал, да сломал. Но эй, я её припаял и продал на авито. Словно вы, блять, никогда не лажаете и все получается. Ну не знал я что подсветка сидит припаянной к плате.
Аноним 06/08/26 Чтв 10:50:00 1669524 238
>>1669425
>>1669421
>>1669416
анон нахуй ты тащишь свою ебаную нерелейтед слопохуету в тред, сьеби нахуй с ней в загон для слопа
Аноним 06/08/26 Чтв 11:20:49 1669549 239
Когда нибудь что то произойдет?
Ждали гемму 120б, не дождались, эира ждали, ламу ждали, от опенаи что то ждали. Одни квены выходят и то уже нехотя и никому не нужны особо
Аноним 06/08/26 Чтв 11:22:52 1669552 240
>>1669549
Каждую недельку выходит новая модель. Оварида не уместна.
Аноним 06/08/26 Чтв 11:32:18 1669558 241
>>1669549
Берешь гемму 31 минимум в q6, радуешься как няша держит контекст, все оче просто и больше ничего не надо для твоей единственной 3090
Аноним 06/08/26 Чтв 11:35:06 1669561 242
4.7 глму так то 8 месяцев уже. Щас год закончится, а на следующий рам только больше подорожает. Т.е вы будете сидеть на 2 годовалой модели и мне ещё говорить что моя устарела
Аноним 06/08/26 Чтв 11:43:02 1669564 243
>>1669516
>это второй уже не было
Была, её просто в кодламу переименовали.
Аноним 06/08/26 Чтв 11:44:11 1669566 244
>>1669561
Не сидит уже почти никто на 4.7 глм. Есть дипсик, есть минимакс.
Аноним 06/08/26 Чтв 11:51:08 1669571 245
Думает, что люб[...].mp4 283Кб, 320x182, 00:00:12
320x182
>>1669566
>дипсик
Кодоунитаз, пишет на уровне мистралей 24б
>минимакс
Для особых любителей видрила и прочих истеричек
мимо сижу на гемме q6 и глм 4.7 q3
Аноним 06/08/26 Чтв 11:55:33 1669574 246
1786006430653.mp4 846Кб, 480x852, 00:00:13
480x852
>>1669566
Говоришь мне снова стоит попробовать дипсик в 2.4bpw?
Аноним 06/08/26 Чтв 12:59:31 1669602 247
>>1669571
>пишет на уровне мистралей 24б
Так это же комплимент получается
Аноним 06/08/26 Чтв 13:05:59 1669610 248
>>1669571
Для тебя есть Hy3. Промту следует, что твоя гемма. С ней у меня было самое быстрое РП в 3 сообщения. Char просто заплутал с user кошель и пошел дальше, пока игрок подыхает и ему было глубоко насрать.
Или в карточке, где мейды убивашки пришли за {{user}}, рп заканчивается на втором ответе бота. Персонаж открывает дверь и ловит привет с дробовика в упор.
Охуенная модель, то что вы любите.
Аноним 06/08/26 Чтв 13:29:18 1669628 249
>>1669610
Какой квант, контекст?
Аноним 06/08/26 Чтв 13:47:02 1669638 250
>>1669628
Q4_xsssss. Контекст 40к. Скорости правда не будет нихуя, ну и это концентрированный кодоунитаз. Зато будет вам нейтральное РП, лул. Я модельку отложил, сугубо потому, что с ней можно чекать промты. Работает как камертон с инструкциями. Если персонаж блядь, будет вести себя как блять, ну ты понел крч. Но особо губу не раскатывай, из за того что это кодоунитаз пишет он так себе, не имея ритма и сваливая всю инфу в одно ведро и обожает структурные лупы. Но умный, да. Бля. Реально гемма.
Аноним 06/08/26 Чтв 14:00:20 1669647 251
>>1669638
У меня нет на гемме структурных лупов. Пиздец, столько говняка про нее в треде читаю. И лупится, и разнообразия нет, и на хуй бросается. По факту единственная проблема это реально хуевенький на фоне дельтанетов и прочих аттеншн. По крайней мере, если сидеть на Q6. Он прям сильно лучше, чем Q4. Hy3 попробую таки позже, окей.
Аноним 06/08/26 Чтв 14:31:36 1669660 252
1786015791980.jpg 628Кб, 972x856
972x856
1786015791984.jpg 28Кб, 720x366
720x366
1786015791985.jpg 126Кб, 794x2048
794x2048
1786015791987.jpg 943Кб, 1080x1683
1080x1683
Пидорасы и клоуны. Абсолютно все.
Вот, смотрите, мы топим за опенсорс, вот вам наша самая толстая и главная моделька!
А другие размеры, которые я экшели смогу запустить локально, будут? Нууэээыы давай там в общем, пакеда.
Куртка туда же, всем по ии, топлю за открытые модели!
Дядя хворанг а можно хоть капельку врам?
Нууэээыыы 4 пикрил
Аноним 06/08/26 Чтв 14:34:49 1669663 253
>>1669660
Опен сорс не то же самое, что запуск на инвалидном консумерском железе. Потерпишь. Энтузиасты и малые бизнесы кайфуют от этих релизов
Аноним 06/08/26 Чтв 14:38:31 1669666 254
>>1669663
Автобот спешит на защиту китаебарена!

Воистину, если для тебя: ой, а мы и не знали что вы хотите запускать локально это не очевидный троллинг, то ты сам себе бака.
Аноним 06/08/26 Чтв 14:38:37 1669667 255
>>1669660
27b новый таки обещали. Но да, Алибаба - контора пидорасов. Новый ван зажали, новые картиночные модели зажали. Скорее всего то же самое и ллмки ждёт в будущем. Уже начали релизы пропускать, 3.7 в опенсорсе не было.
Аноним 06/08/26 Чтв 14:40:27 1669669 256
>>1669666
>это не очевидный троллинг
Не, не троллинг. Ученые которые разрабатывают эти модели не кумеры, не генерят всякую дичь и спокойно используют апи своих лаб, чтобы делать реальные задачи. Им непонятно зачем нужны маленькие модели, за редким исключением. Сам себе бака всё-таки тот, кто думает что весь мир крутится вокруг них и их хуйка. В рот все эти лабы ебали твои кумерские задачи, и правильно делают
Аноним 06/08/26 Чтв 14:42:57 1669671 257
image 612Кб, 862x646
862x646
>>1669669
>и правильно делают
В агентотред, животное. Быстро, решительно.
Аноним 06/08/26 Чтв 14:45:39 1669675 258
>>1669671
Спокуха, вахта. Ничего не мешает мне юзать модели для кума и быть реалистом. Тебе тоже пора повзрослеть, в своей-то шкуре 40+ лет
Аноним 06/08/26 Чтв 14:48:27 1669676 259
>>1669669
Да, вот только достаточно посмотреть что было с их эйром на запуске. Сложить 2 + 2 и понять, что они все прекрасно видели. Почитать что они писали и обещали.
Заи обыкновенные балаболы, что не нашли яиц в открытую написать: вот новые модели, покупай падпеску и гладь своих тянок.
Аноним 06/08/26 Чтв 14:51:08 1669677 260
>>1669676
Тяжела жизнь идиота, которому все должны. Вечно разочаровываться во всех вокруг
Аноним 06/08/26 Чтв 14:53:50 1669678 261
image 441Кб, 1192x1194
1192x1194
Аноним 06/08/26 Чтв 14:55:37 1669679 262
изображение.png 496Кб, 600x422
600x422
>>1669669
Ну наконец-то кто-то это сказал, блеать. Пройдет еще пара лет и тредовички поймут, почему именно стартовал тренд на open weight модели
Аноним 06/08/26 Чтв 14:58:19 1669681 263
Аноны, есть смысл юзать вот эти новые мистраль смол и квен, которые 120б, в 4 кванте? Не для кума, обычного рп, который не будет вызывать отказов.

Я просто не знаю, качать ли эту ебанину, ибо скорость интернета маленькая и модели будут пукать на 7 тс.

Так, почекал онлайн, вроде пишут нормально, но все их засрали и обоссали, будто бы смысла нет, а этот мистраль, такое ощущение, вообще никто не тестил из-за того, что норм поддержки после релиза не было.

Просто непонятно, есть ли смысл по сравнению с квеном 27б и геммой 31б. Ясен хер, они меньше знают в целом по сравнению с геммой из-за разностей датасетов, и та же гемма будет писать 100% лучше, потому что в ней больше литературы. Но может из-за большего размера будут более креативны? Лучше держать длинный контекст? 120б.
Аноним 06/08/26 Чтв 14:58:57 1669682 264
>>1669677
Какой же ты жирный, пиздец просто.
Аноним 06/08/26 Чтв 15:01:22 1669684 265
image.png 92Кб, 345x320
345x320
>>1669678
>>1669682
Кто-то там где-то в твиторе скозал что будет эир 2. Заи пидорасы!! Душат кумеров суки не дают жить! СУКА ДАЙТЕ ПОДРОЧИТЬ ХУЙ! ВЫ ОБЕЩАЛИ!!!!!!!!!!!!!!
Аноним 06/08/26 Чтв 15:06:38 1669689 266
>>1669684
>где-то в твиторе
На обниморде.
>Кто-то скозал
Сказал человек из команды заек.
>что будет эир 2
Что будет эйр 4.6 и он уже в работе, вот-вот выкатят.
>ВЫ ОБЕЩАЛИ
Да, всё верно. И не выкатили. За это и были накормлены хуями.

Ну прекращай уже, анонче. Это не вызывает баттхёрта, это не смешно. Это просто, ну... тупо? Перестаю тебя кормить, хорошего понемногу.
Аноним 06/08/26 Чтв 15:07:59 1669690 267
изображение.png 151Кб, 1501x612
1501x612
Бля местные реально до сих пор верят что локальные модели создаются чтобы они вертели хвосты лисодевочкам
>Куртка туда же, всем по ии, топлю за открытые модели!
>Дядя хворанг а можно хоть капельку врам?
Так вот же, пикрил, покупай и используй. Когда хуанг говорит что он за опенсорс модели, он имеет ввиду именно покупателей пикрелейтед серверов и профессиональных карт за кучу зелени. Он никогда не говорил, что нвидия обеспечивает возможность локально запускать модели всем желающим. Он НИКОГДА не говорил, что в его интересах запуск обычными консумерами <100б моделей на RTX картонках. Ну вы как дети, чесслово.
Аноним 06/08/26 Чтв 15:09:51 1669691 268
>>1669681
Мистраль Смолл 120б пишет плюс-минус на уровне 24б 3.1. Может даже чуть хуже. Квен 122б хорош как ассистент, но в рп соев и покладист. Не может отыгрывать антагонистов и даже просто грубых персонажей, которые по своей натуре не желая никому зла выражаются грубо, не умеют разговаривать. Даже таких через респонс он приведет к "сорян, я чет правдап правда перебрал, не буду больше так", слишком ассистент-максед. Лучше всего контекст держит Квен 27, из того что для рп подходит
>>1669689
Да, другое дело вспоминать об этом спустя год и ныть на борде. Совсем не тупо
>>1669690
>как дети
Они и есть, только в шкуры околоскуфов уже. Адекватных тут мало и подолгу не задерживаются
Аноним 06/08/26 Чтв 15:13:18 1669694 269
>>1669669
Раз уж тут все ради ученых в говне моченых, то почему в принципе существует что-то ниже 120b, так и дрочили бы на 500b+ у ученых в говне моченых стоят свои кластеры на которых можно любую модель запускать.
Аноним 06/08/26 Чтв 15:25:40 1669697 270
>>1669694
Так в говне моченые тоже хотят быстрый инференс, а для этого нужны легкие draft модельки размера 27b, которые тупые, но могут предсказывать ~70% токенов правильно от их большой модели. А вы тут итт с каких то хуев решили что это полноценные замена которой можно пользоваться. Долбоебы.
Аноним 06/08/26 Чтв 15:38:24 1669704 271
>>1669660
>А другие размеры, которые я экшели смогу запустить локально, будут?
Так сказали что 27В будет, а ответ был про другие модели кроме 27В и крупной.
Откровенно говоря ничего кроме 27В и не нужно. 122В показала себя на уровне 27В. Мелкая хуйня просто не нужна.

>>1669667
>3.7 в опенсорсе не было.
Потому что конторы такого уровня если выпускают что-то - это должно быть что-то выдающееся, иначе урон репутации, особенно с локальными модельками, где любой может и сам проверить модель - там говно за конфетку не выдашь.
Аноним 06/08/26 Чтв 15:53:15 1669712 272
>>1669697
Нет, для предсказания токенов есть мтп, оно и предсказывает лучше и стоит меньше.
Мелкомодели нужны потому что открою тайну - ими регулируют нагрузки на сервера, когда нагрузка слишком большая - то с условного дипсика про часть пользователей тихо на время переключают на флеш, с чего потом и идет все нытье что модели лоботомируют после запуска.
Аноним 06/08/26 Чтв 16:35:04 1669733 273
image.png 630Кб, 1420x497
1420x497
Кто там блядь гнал на дипсик что он кодоунитаз? А ваш кодоунитаз такое пишет?
Аноним 06/08/26 Чтв 16:45:52 1669740 274
>>1669733
>Третья рука
Ты там мутанта из чернобыля отыгрываешь?
Аноним 06/08/26 Чтв 16:48:41 1669742 275
>>1669733
Не знаю, кто писал. Дипкок единственная не кодоунитазная модель. Что 3.2 (эта вообще 10/10), что 4 флеш и про. Литературный датасет там приличный. Всякий кал типа кими и парашного квена 2Т+, который скоро выложат впопенсурс, рядом не стоит. Разве что глм 700б приемлемая относительно, но цензура там адская.
Аноним 06/08/26 Чтв 16:49:35 1669744 276
>>1669712
Мтп это не замена драфт моделям, это разные подходы которые дополняют друг друга
Аноним 06/08/26 Чтв 16:55:55 1669750 277
Имеется тесла в100 на 32 гб, и сервак на 128 гб ддр3 оперативки. Хочу потетстить разные большие моешки. Что анон может посоветовать?
Пока что в списке: дипписик-4-флэш, минимакс M2.7 (и M3, но это IQ_2_XS - максимум), ну и какой-нибудь жлм-4.7 для референса.
Что еще посоветуете? Алсо, писику поддержку в Жоре уже подвезли?
Аноним 06/08/26 Чтв 16:57:44 1669751 278
>>1669744
>Не знаю, кто писал.
Да вот этот >>1669571
>Дипкок единственная не кодоунитазная модель.
Ну гемма еще, бимбоунитаз треда заслуженный. Для кода она меньше годится чем для членов.
Аноним 06/08/26 Чтв 16:58:32 1669752 279
Аноним 06/08/26 Чтв 17:01:27 1669754 280
>>1669750
>Что еще посоветуете?

Попробуй Hy3, step 3.7 и Laguna M1. Там еще что-то выходило, но я уже не помню.

>писику поддержку в Жоре уже подвезли

Подвезли.
Аноним 06/08/26 Чтв 17:10:56 1669758 281
>>1669733
>>1669740
Как в классике, "...он вас в рыло, а вы его в ухо, в другое, в третье – и разойдитесь..."
Аноним 06/08/26 Чтв 17:30:02 1669767 282
>>1669733
>анус хлюпает
Похоже подлива потекла.
Аноним 06/08/26 Чтв 17:38:30 1669771 283
1786027110832.png 397Кб, 1344x1884
1344x1884
Запускаем риги обратно. Праздник жизни заканчивается
Аноним 06/08/26 Чтв 17:39:51 1669774 284
177238861909509[...].mp4 409Кб, 560x344, 00:00:08
560x344
Аноним 06/08/26 Чтв 17:48:55 1669779 285
>>1669733
Один единственный лог не выявит структурные лупы, репетишен, биас, сою и цензуру. А этого там с лихвой, на флешке точно. Да, цензура это не только прятать слова "хуй" и "пизда", она там умная как у Мимо. Партия одобрила - получишь свой сочный аутпут
Аноним 06/08/26 Чтв 17:56:35 1669784 286
>>1669779
>структурные лупы, репетишен
Их там нет, могу сказать точно. Отыграл на новом дипсике уже ролеплей на 120к.

>биас, сою и цензуру
Она есть, и я как раз про нее писал вот тут >>1668108 →
Вообще говоря, после геммы читать про персонажей что не прыгают на твой хуй с разбега - приятное разнообразие. К тому же она не отказывается описывать вообще ничего когда ты прямо к этому
подводишь.
Аноним 06/08/26 Чтв 18:00:09 1669786 287
>>1669784
>120к
И конечно не покажешь? В моих чатах уже на 20к теряются характеры персов и настигают лупы. Своему опыту верю больше, буду рад поверить твоему
Аноним 06/08/26 Чтв 18:00:10 1669787 288
image.png 281Кб, 2491x1345
2491x1345
image.png 320Кб, 2446x1466
2446x1466
image.png 279Кб, 2118x1129
2118x1129
Обнаружил еще одно охуенное применение задачки "Смоделируй Солнечную систему в консольке" для оценки нейронок.
Васянотюны и аблитерации.
ИТТ было много визгов что современные аблитерации не портят модель.
А на huggingface для конкретного этого васянотюна https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF стоит уже неделю ебанутый хайповизг что это прорыв и восьмое чудо света - с уже почти 2млн скачиваний на хайпе.
И что самое забавное - она по всем бенчам на проценты, а местами и десятки процентов типа лучше ванильного qwen3.6-27b.

Так вот, что касается "Смоделируй Солнечную систему в консольке".
- Ванильная qwen3.6-27b ее делает худо-бедно рабочей КАЖДЫЙ раз - по крайней мер расчет. Рендеринг в консольке всегда кривоватый, планетки то все собраны в кучку и не шевелятся на масштабе, то их пидорасит по всему экрану скроллингом, но если это подправлять то худо симуляция работает.
- Все аблитерации, и вот эта вот Fable-Fusion-711 - в двух прогонах из трех ОБСИРАЮТСЯ ПО ПОЛНОЙ. Некорректно считают ускорения-силы, берут какие-то дикие, отличающиеся в тысячу раз массы планет, путают масштабы и единицы измерения... Короче ЛАЖАЮТ ПИЗДЕЦ КАК.

В том числе Fable-Fusion-711. Которая по всем тестам якобы стабильно лучше базовой qwen.
Но на этой простой задачке - сxоду видно что нихуя она не лучше. Она в разы тупее и рассеяннее. Лучше она может быть только на каких-то шаблонных тестиках из бенчей. А чуть что в сторону от шаблонов, требующее сообразить-подумать - все, пизда, васянотюн сразу шизеет.

Такие дела.

И да, это не про кодоунитазность. Это и про способность выдержать логику повествования/РП тоже.
Аноним 06/08/26 Чтв 18:03:43 1669790 289
Да ну нахер эти большие модели. Как же долго этот говняк качается... Казалось по памяти, что время быстро проходит - но нет.
Аноним 06/08/26 Чтв 18:06:46 1669792 290
Анончик, а дай пожалуйста конфиг (Context Template) для квена 122 с thinking.
Аноним 06/08/26 Чтв 18:09:01 1669795 291
>>1669787
>что самое забавное - она по всем бенчам на проценты, а местами и десятки процентов типа лучше ванильного qwen3.6-27b
Строишь датасет на основе вопросов из бенчей, жаришь на нем модель, получаешь прибавку. Но это конечно сразу не догадаешься, что так можно было. Это нужно быть инженером по машинлерну как минимум.
Аноним 06/08/26 Чтв 18:10:22 1669797 292
>>1669771
Пришло время окупать AI-пузырь.
Аноним 06/08/26 Чтв 18:14:54 1669802 293
>>1669795
Дак как бы да, но блять почти два миллиона скачиваний за неделю и топ-2 модель на HF.
Я просто подумал было что чувак и впрямь магию сотворил. Ну хуй там плавал... Прилежный девятиклассник на уроках программирования косячит меньше с моделированием солнечной системы чем этот франкенштейн :(
Хотя если б не эта проверка - я бы мог наверное попасть под впечатление что это алмаз в куче навоза.
Аноним 06/08/26 Чтв 18:16:17 1669803 294
>>1669787
Как неумение создать модель СС на дотнете ухудшает все ее остальные свойства?

Типа, миллионы мух ошибаются! Этот тюн не смог пройти мой тест! Он говно!
Аноним 06/08/26 Чтв 18:17:23 1669805 295
>>1669660
Справедливости ради, раньше модели выходили раз в год и все были счастливы. Сейчас в 2026 году уже выходил Qwen3.5, 3.6 и сейчас еще один выходит. И это только середина года, я так думаю к концу еще и четвертое обновление будет.

Мне, конечно, не очень нравится тенденция ухода в триллионные модели, но пока я получаю хотя бы две MoE ~30B в год (Qwen, Gemma), в целом жить можно. Хотелось бы, конечно, увидеть MoE 30B модели от DS или там GLM или еще от каких-то китайцев, но квен с геммой покрывают 90% задач, одна художественные, вторая технические.

Вот чего мне не хватает так это 24B dense моделей. Делают сраные 27B и 31B которые нормально в 16GB не лезут. Сделали бы 24B плотные квеногеммы, они бы замечательно влезли в 16GB с 50к контекстом. Так нет, сделаем те которые жрут 17-18GB VRAM и приходится выбирать третий квант который не то чтоб сильно умнее Q6/Q8 MoE моделей.
Аноним 06/08/26 Чтв 18:18:31 1669806 296
>>1669787
>ИТТ было много визгов что современные аблитерации не портят модель
Это аблиткошиз, дурачок местный. Не обращай на него внимания.
Аноним 06/08/26 Чтв 18:19:59 1669807 297
>>1669802
>почти два миллиона скачиваний за неделю и топ-2 модель
Нагон бичей из внешних источников уже давно практикуется. Вон че далеко ходить - обезьяна в своей телепараше тоже постит периодически про опасные модельки. Хомяк который никогда локалки не трогал видит это, бежит качать, запускает и удивляется. Потом строчит коммент что это ниибаца что такое фейбл клауда хайку у меня на компутере. При том оригинальную модель он не тестил, другие локалки не тестил и вообще скорее всего это его первая локалка в жизни. Мы вон тут в свое время ламе второй радовались когда она просто запускалась, уж не говоря про перформанс.
Аноним 06/08/26 Чтв 18:25:08 1669812 298
>>1669787
>как смоделировать солнечную систему не привлекая внимания санитаров
записал в шизов треда
Аноним 06/08/26 Чтв 18:25:41 1669813 299
>>1669803
>Как неумение создать модель СС на дотнете ухудшает все ее остальные свойства?
Ты долбоеб походу.
Речь не о том что модель не может в принципе ее создать.
Речь о том что она ПОТЕРЯЛА СПОСОБНОСТЬ СОЗДАТЬ ЕЕ в ходе аблитерации / тюна.
Ванильная модель может. Тюн/аблитерация НЕ может.

Речь том что модель покоцалась. В принципе покоцалась. Потому что нельзя покоцать навыки в .net не покоцав другие. То есть - модель стала хуже.
И задача на создание симуляции солнечной системы это надежно выявляет - в отличие от десятков маня-тестиков с тысячами тупорылых шаблонных маня-задачек.
Аноним 06/08/26 Чтв 18:28:49 1669816 300
>>1669812
Свой вариант быстрой и наглядной проверки можешь предложить, который надежно показывает что тот же https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF существенно хуже чем ванильная qwen3.6 27b, вопреки всем тестикам убеждающим в обратном? Нет? Значит чмоха тупорылая
Аноним 06/08/26 Чтв 18:29:40 1669817 301
Аноним 06/08/26 Чтв 18:31:09 1669819 302
Аноны а кто нибудь "стримит" чат моделей на телефон когда она крутится на пука, хочется чтобы можно было использовать лежа на диване а не пердеть за компом
Аноним 06/08/26 Чтв 18:31:59 1669820 303
>>1669819
Я стримлю. Но у меня самописный интерфейс, поэтому я не уверен что тебе мой опыт поможет.
Аноним 06/08/26 Чтв 18:33:35 1669822 304
>>1669816
>Свой вариант быстрой и наглядной проверки можешь предложить
>Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
Если в названии больше тире чем символов в названии материнской модели - скорее всего это говно переваренное в говне и нафаршированное калом.

мимо
Аноним 06/08/26 Чтв 18:35:55 1669823 305
>>1669816
Узбагойся, я вообще гунер.
Аноним 06/08/26 Чтв 18:39:29 1669829 306
>>1669797
Ну а чо? Дали первую дозу, а дальше пора стричь.
На деле если они сделают х2-х3 то всё равно будет демократично по сравнению с ебучими антропиками которым 10 баксов это минут 5-10 работы агента (речь об апи)
Аноним 06/08/26 Чтв 18:40:31 1669830 307
>>1669819
У многих general purpose агентов управление через гейтвей со всеми возможными мессенжерами это основной режим работы.
Для нейтрального чатика по апи типа опенвебуи (но продвинутые прибамбасы по желанию тоже есть) самое лучшее что видел это RikkaHub
Для рп открывай веб таверну/маринару с компа на телефоне
Аноним 06/08/26 Чтв 18:44:24 1669835 308
>>1669786
Ясен хуй он тебе ничего не покажет. Это тебе не чайный клуб, тот гигачад играет ваниллу и отвечает за базар, показывая логи. Литерально мой герой.
Аноним 06/08/26 Чтв 19:01:36 1669846 309
1723681974452.png 542Кб, 718x1000
718x1000
>>1669690
> Бля местные реально до сих пор верят что локальные модели создаются чтобы они вертели хвосты лисодевочкам
Yes.
По крайней мере я для этого риг собрал, а значит наши интересы пересекаются.
Аноним 06/08/26 Чтв 19:02:35 1669848 310
>>1669786
>И конечно не покажешь?
Могу показать одно-два сообщения, но ты же скажешь что нещитово. А весь диалог слишком обскурен даже для этого треда. И вообще, я тебя пруфы
>структурные лупы, репетишен
показывать не прошу.
Аноним 06/08/26 Чтв 19:05:39 1669853 311
>>1669848
>нещитово
И буду прав, ведь одно два сообщения ничего не демонстрируют кроме одиночных выводов
>я тебя пруфы показывать не прошу
Даже если я их принесу, ты справедливо сможешь сказать, что нужно переделывать с другими семплерами, квантом, фазой луны. Смотреть не на что. Зато когда есть логи чего-то работающего, можно разобрать как так получилось и помочь другим
Аноним 06/08/26 Чтв 19:30:56 1669868 312
>>1669802
Дэвид в целом странный феномен. Чел всё время делает долбоёбство. Его тьюны немо были на порядки шизовее средних по палате, при том, что от них особо и не ждёшь ничего. Какие-то нахер никому не нужные опыты с франкенмёржингом 3б моделей, от которых они переставали влезать в память смартфона, но при этом становились ещё тупее, чем были изначально. Ебанутые классификации моделей по сэмплерам с табличками, из которых было видно, что он вообще не понимает, что делает тот или иной сэмплер. И при этом популярен.
Аноним 06/08/26 Чтв 19:48:17 1669878 313
Аноним 06/08/26 Чтв 20:16:14 1669898 314
>>1669878
У тебя что ли нет рига из В100 или на худой конец про6000? Нищеброд? Ну можешь фуллозу запускать, как ныне дипсик флэш.
Аноним 06/08/26 Чтв 20:25:24 1669906 315
>>1669878
Не трогай, это для учены.
Аноним 06/08/26 Чтв 20:44:00 1669920 316
Бля, чайный клуб, а не зашаришь карточку самого клуба? Мне интересно что там за промты. И давно у нас чата с девицами не было в тредах
Аноним 06/08/26 Чтв 20:45:20 1669921 317
>>1669868
>при этом популярен
Потому что до сих пор регулярно завозит. Много кто из тюнеров "золотой эпохи" просто пропал, новые приходят крайне редко, а остались в основном как раз шизы которые и тогда пачками штамповали и сейчас штампуют. Плюс кумеры народ непривередливый, они сожрут любую модель которую под рп тренировали, лишь бы она про сисик и писик писала.
Аноним 06/08/26 Чтв 20:58:37 1669929 318
>>1669754
>Hy3
Поставил на скачку после минимакса, степфан гонял по апи, мне не зашло.

Алсо, что за херня с дефолтной лламой? Запускаю лламу на IQ4_NL анслопов, а оперативка пустая (ну точнее 125 жигобайт закэшировалось), занято 10 жигобайт в памяти. Это давно так? Когда жпт-осс-120 запускал было не так.
Аноним 06/08/26 Чтв 20:58:57 1669931 319
>>1669921
Так модели теперь то перетренированная из коробки то МоЕ которую хуй знает как тюнить
А так вон assistant pepe 70b охуенный вышел
Аноним 06/08/26 Чтв 20:59:58 1669934 320
>>1669929
Многие режимы загрузки не отображают реальное потребление. Особенно дефолтный mmap
Аноним 06/08/26 Чтв 21:11:11 1669942 321
>>1669931
В чем проблема с тюном мое? Там же все автоматизированно должно быть. Не нужно руками эксперта выбирать под каждый семпл.
Аноним 06/08/26 Чтв 21:13:46 1669945 322
семпл демпл
Аноним 06/08/26 Чтв 21:16:24 1669947 323
Смешной прекол увидел в логе лламы:

operator(): unauthorized: Invalid API key. Сложно имагинировать, что какой-нибудь фуфел стал бы долбить мою лламу в моей же локалке. Учитыая, что у меня довольно ограничивающий фаервол на редхат серваке. Сервак лламы сам себе что ли долбит?
Аноним 06/08/26 Чтв 21:28:44 1669961 324
>>1669947
У тебя на локалке закрытый апи ключ?
Аноним 06/08/26 Чтв 21:48:59 1669971 325
Бля, обожаю такую хуйню: когда нахожу новый файнтьюн, на странице которого автор пишет «бля буду, датасеты чистые от слопа, модель очень креативная», захожу в комменты — там какой-то шизик расхваливает модель, прикрепив скриншоты, а на скриншотах 5 smirks, 4 mischief и 6 chuckles в одной мессаге.
Аноним 06/08/26 Чтв 22:01:39 1669980 326
Аноним 06/08/26 Чтв 22:31:29 1669993 327
>>1669947
У меня такое было. Обновление Лламы решило проблему.
Аноним 06/08/26 Чтв 22:34:04 1669996 328
>>1669681
Для RP от квена 122B толку не сильно больше, чем от 27B. Скорее наоборот, т.к. на последний таки есть тюны под RP заточенные и пишущие довольно живо (особенно на английском). А 122B - он практически сам по себе, и язык у него суховат при этом. Что до логики - в RP он тоже не особо от 27B отличается по этому вопросу. Несколько лучше, да, но не так, чтоб прямо ради этого терпеть размеры и специфику языка. Если 27B влазит в VRAM - он еще и быстрее будет, даже на 2х3060. При этом если RAM всего 64GB, то влезет исключительно iq4xs квант, и контекста будет меньше, чем можно получить от 27B на тех 24 VRAM.

>Но может из-за большего размера будут более креативны? Лучше держать длинный контекст? 120б.
Вот тут точно нет. 122B не более креативна чем 27B и тем более - ее тюны. Контекст держит примерно так же до ~40к, но у меня нет возможности сравнивать дальше - больше от 122B не лезет. А 27B до 75-80K вполне норм.

>>1669802
>Дак как бы да, но блять почти два миллиона скачиваний за неделю и топ-2 модель на HF.
Чел, я ее тоже скачал и в opencode пощупал на разном. Она специфична. Зерошоты делает хуже, да. А вот четко поставленную задачу выполняет быстрее и лучше. Если нужно не абстракции по короткому промпту креативить, а конкретную рутину повторяющуюся делать - как бы и предпочтительнее получается.
Аноним 06/08/26 Чтв 22:40:02 1669999 329
>>1668210
>>1668203 (OP)
Где искать кастомную гемму для рп на 3060 + 32 гб?

Видел тут предлагали какую-то gemma-4-26B-A4B-it-heretic, она влезет в такой конфиг? Как она в плане рп?

Стокое зацензуренное говно не предлагать.
Аноним 06/08/26 Чтв 22:47:46 1670006 330
image - 2026-08[...].png 84Кб, 1042x925
1042x925
image - 2026-08[...].png 58Кб, 1048x906
1048x906
1668559183986.png 275Кб, 1174x408
1174x408
1741792529827.png 450Кб, 1356x646
1356x646
И еще вопрос, что за фронтенд на пиках? Видел в прошлых тредах
Аноним 06/08/26 Чтв 23:19:18 1670037 331
Аноним 06/08/26 Чтв 23:19:19 1670038 332
>>1669999
Нигде. На 26б нет живых тюнов, только Меромеро
>>1670006
Слева лламацпп, справа лмстудия
Аноним 06/08/26 Чтв 23:47:37 1670060 333
1786049153781.jpg 598Кб, 1080x2400
1080x2400
Ехуу а говорите моделей нет!
ЖИВЕЕЕМ!
Аноним 07/08/26 Птн 00:30:12 1670085 334
Аноним 07/08/26 Птн 00:35:26 1670092 335
>>1670037
>>1670038
Спасибо. А какую модель можете посоветовать для рп?
Аноним 07/08/26 Птн 00:50:07 1670095 336
Аноним 07/08/26 Птн 00:55:47 1670100 337
Аноним 07/08/26 Птн 01:03:26 1670104 338
>>1670060
Как выпустят надо будет попытаться в двух битах запустить, для ролплея может и хватит.
Аноним 07/08/26 Птн 01:04:13 1670105 339
>>1670095
Топ модель, три месяца работает как агент-оркестратор на локалке, кое че может поковырять в настройке ПК или легком программировании.
Аноним 07/08/26 Птн 01:12:09 1670107 340
>>1670105
>три месяца
>модели 21 день
Отзыв писал Фэйбл.
Аноним 07/08/26 Птн 01:19:39 1670109 341
Ребзичи, нужен хелп. Подскажите пож может ли какая-нибудь модель с ходу по инструкции развернуть мой набросок-пересказ на 7000 слов в полноценный рассказ на 12-15 тысяч слов без всякой мозгоебли? Grok просто говно бесполезное нахуй, а Gemini развоняется про цензуру.

Есть вроде всякие SudoWrite / NovelAI но я не хочу отдавать 20$ за хуй пойми какую LLM. Там может такое же говно как и Grok, ебу я...

Есть 10$ на балансе vast.ai если че. Что туда толкового можно подкачать?
Аноним 07/08/26 Птн 01:34:30 1670115 342
>>1669647
>По крайней мере, если сидеть на Q6. Он прям сильно лучше, чем Q4
И много тут у кого 5090 что его запустить?
Аноним 07/08/26 Птн 01:36:56 1670118 343
Аноним 07/08/26 Птн 01:46:28 1670120 344
>>1670115
Тут разве мало 32+ гиговых? Наверно побольше чем 16 и менее бедолаг.
Аноним 07/08/26 Птн 01:48:34 1670121 345
>>1670115
В 24 гига спокойно лезет с небольшим оффлоадом. 64к контекста, 11 токенов. Тут немало у кого 3090.
Аноним 07/08/26 Птн 01:51:15 1670123 346
Аноним 07/08/26 Птн 01:52:44 1670124 347
>>1670121
>11 токенов
Про ризонинг можно забыть. И смысл менять ризонинг на чуть больший квант?
>64к
Да сразу сто, двести.
Аноним 07/08/26 Птн 01:54:57 1670126 348
>>1670124
>Да сразу сто, двести.
Я буквально запускаю с 64к неквантованного контекста Q6 на своей 3090. В чём причина рвонька?
>>1670124
>смысл менять ризонинг на чуть больший квант?
Хз, скачай, попробуй, может поймёшь
Аноним 07/08/26 Птн 02:01:23 1670128 349
>>1670121
Я пробовал так же когда она выходила, сбавлял слои --n-gpu-layers пока не влезла, выходило 8т.с с квантованным контекстом.
Какую команду используешь?
Аноним 07/08/26 Птн 02:01:32 1670129 350
>>1670118
Судя по этому списку такие модели все PG-13.
Аноним 07/08/26 Птн 02:14:33 1670133 351
1786058073441.png 335Кб, 1316x1452
1316x1452
>>1669388
А теперь в плюс вышел. Самое интересное гемму 31 к8 чекнуть и дикпик. На гемме раньше 30 тпс было.
Правда пришлось в рокм профилировщике поразбираться, а фиксанулось всё переключателем в llvm при сборке.
Ещё вернуть разгон памяти и будет пушка за копейки.
Хорошо что тема с анлоком майнинговых курток быстро цены подняла, а то руки чесались слишком сильно по старым и можно было сорваться
Аноним 07/08/26 Птн 02:22:04 1670138 352
>>1670129
Если там совсем в тексте жесть то можно арендовать сервер с GPU и поднять какой-нибудь свой файнтюн 26B/31B Геммы там, стоимость от ~0.5$/час идет за машинку с 48GB VRAM. Но порекомендовать где арендовать на своём опыте не могу, знаю что такие сервисы есть, но необходимости пользоваться ими не было.

Или самый простой способ это поднимать свой файнтюн 26B геммы локально если есть хотя бы 16+8, в идеале 32+16. Люди вон РПшат всякую жесть на ней, думаю и твой текст переварит.
Аноним 07/08/26 Птн 02:37:13 1670142 353
>>1670138
Не жесть, просто вагинальный секес.
Аноним 07/08/26 Птн 02:38:39 1670143 354
>>1670109
Кими/дипсик. Но это все равно попытки компенсировать собественную лень жирностью модели. В идеале с нею сначала перевести набросок во что-то структурированное, раскидать на главы и оценить примерный их размер-содержание. А потом уже отдельным запросом постепенно скармливать план глав на вход и получать хороший выход.
Хотя
> 12-15 тысяч слов
Такое и зирошотом могут справиться, это немного. Но лучше хороший вход и бить на части как описано.
>>1670138
> файнтюн 26B/31B Геммы
> машинку с 48GB VRAM
> свой файнтюн 26B геммы локально если есть хотя бы 16+8, в идеале 32+16
Лол, DavidAU залогинься.
Аноним 07/08/26 Птн 04:22:50 1670165 355
пупупупупупупу...
Аноним 07/08/26 Птн 06:08:49 1670172 356
Впадлу с разметкой разбираться.
Я правильно понимаю, что если ставишь chatm на модели с другой разметкойl, то и ризонинг нужно отрубать как на chatml, типа:
<think>

<think>
Даже если у модели в разметке он отрубается через <think><think>
Аноним 07/08/26 Птн 06:23:30 1670174 357
image.png 366Кб, 800x452
800x452
Where Qwen-3.8-27b?
Аноним 07/08/26 Птн 09:22:29 1670218 358
image 85Кб, 1700x368
1700x368
>>1670107
Это обновленная версия. Он уже кучу раз обновляет ее.
Аноним 07/08/26 Птн 09:23:53 1670219 359
Аноним 07/08/26 Птн 09:36:47 1670227 360
Господа, простите мне мои дегенеративные вопросы, но мне нужны на них ответы.
Лламацпп скомпилирована под винду под CUDA 12.4 и 13.3. На компе установлена 12.4 (у меня V100 третьей видеокартой, на 13.х не перекатиться).
Если мне необходимо для работы с Comfy поставить CUDA 12.8 или 13.0 - как мне это организовать? Мне надо перекомпилировать лламу под 12.8 (не знаю как это сделать, но допустим), или можно llama.cpp как-то выделить окружение, в котором будет жить CUDA 12.4?
А может я просто тупой и это всё делается через venv (было бы збс), в котором будет запускаться ллама?
Аноним 07/08/26 Птн 09:47:10 1670231 361
>>1670227
Вроде бы у тебя могут паралельно стоять несколько CUDA, главное чтобы нейронки могли разобраться и запустить нужную. Должно быть правильно прописано в PATH системы, и сами приложения должны искать не по CUDA 12.x а конкретно по версиям, CUDA 12.4 CUDA 12.8
Аноним 07/08/26 Птн 09:52:49 1670232 362
>>1670227
Сорян, но побуду линуксятником которого не звали. Докер/куб решает проблему бай дизайн, каждая нагрузка работает с тем рантаймом в который ты его положил
Аноним 07/08/26 Птн 10:02:26 1670233 363
>>1670227
А на v100 вообще можно 12.8 поставить? У меня 580 драйвер и у v100 cuda 12.4
Аноним 07/08/26 Птн 10:26:30 1670254 364
Equinox-31B.jpg 1765Кб, 1920x960
1920x960
>>1669999
>>1670038
Есть вариант Gryphe/Gemma-4-26B-A4B-StyleTune-V2 от одного из работников AI Dungeon. Но сами ai dungeon выпустили только модель Equinox-31B пока что на gemma 4 31b, но для запуска надо минимум 24 гб откуда угодно высрать, либо никак вообще.
Аноним 07/08/26 Птн 10:39:08 1670259 365
>>1670233
>А на v100 вообще можно 12.8 поставить? У меня 580 драйвер и у v100 cuda 12.4
Хз, но вроде поддержка Вольт в 13.х отвалилась.
Значит теоретически 12.8 должна работать, но я не проверял пока.
С llama.cpp всё просто. С Forge Classic Neo всё просто. С Комфи ебанина какая-то лютая, ору чаечкой уже два вечера в попытках присрать туда raylight для генерации на нескольких видеокартах сразу (4060ti-16+3060-12). Только вот сию секунду допёр, что v100 надо попробовать скрыть нахуй от комфи, вечером попробую.
Аноним 07/08/26 Птн 10:39:46 1670260 366
1786088387219.jpg 254Кб, 907x1508
907x1508
УХОДИТ ЭПОХА залетайте в последний вагон за дешевым кумом
Аноним 07/08/26 Птн 10:42:11 1670262 367
>>1670260
>API
Это что за слово такое?
Залетел тебе в ротеш. У нас бесплатный кум.
Аноним 07/08/26 Птн 10:44:32 1670263 368
>>1670260
Значительно это во сколько? Если в 2 раза то это несущественно. Кстати заметил что появилась опция рассуждений low.

Раньше была высокая максимальная и дефолтная. По моим оценкам низкой вполне хватает чтобы выполнять агентские задачи по запуску скиллов и мелких подстраиваний под ситуацию.
Аноним 07/08/26 Птн 10:46:50 1670265 369
>>1670172
Дядь ты дурак ? если тэга нет в токенайзере модели, он для нее как обычный текст. Типа псевдо xml которым в карточках персов иногда насрано. Типа "ну высрал тут юзер какую-то поеботу, поиграемся чо уж". На поведении модели глобально это не скажется ровно никак.
Аноним 07/08/26 Птн 10:48:13 1670266 370
>>1670262
Девок на 128к не квантованого контекста в зад долбал?
Аноним 07/08/26 Птн 10:55:00 1670268 371
>>1670259
> raylight
Сомневаюсь что оно под виндой вообще просто так будет работать из-за nccl
Аноним 07/08/26 Птн 11:05:52 1670273 372
Анончеги, сидел читал треды, которые пропустил за последние две недели. Заинтересовался обсуждением геммы4 26b-a4b, но так и не нашел ответа на свой вопрос. 26b-a4b действительно более зацензурена чем 31b или нет? И если да, то какая аблитерация меньше всего теряет в мозгах?

В моем сете я гоняю на 2*3060 (+ затычка t400 4gb под винду), на одной карте 26b, на второй comfy генерит картинки
Аноним 07/08/26 Птн 11:16:54 1670278 373
>>1670254
>Но сами ai dungeon выпустили только модель Equinox-31B пока что на gemma 4 31b

Пробовал, высер, сильно тупее обычной геммы, рассыпается на сложных ролеплеях там где обычная еще держится, не рекомендую.
Аноним 07/08/26 Птн 11:24:16 1670284 374
>>1670260
Чел, мы на этом самом дипсике кумим мало того что бесплатно, так еще и беспалевно и с полным контролем над шаблоном.
Аноним 07/08/26 Птн 11:26:42 1670285 375
>>1670260
Может быть у дипсика появится стимул запилить маленькую модельку для каких-то неважных задачек, по типу как glm 4.7 flash. И цена инференса соответственно низкая будет.
С другой стороны, вряд ли от такой модельки можно будет ждать креатива и рп.
Аноним 07/08/26 Птн 11:33:13 1670287 376
>>1670285
>Платить за 30В мое-лоботомитов

Аицгшники, вы там совсем обезумели?
Аноним 07/08/26 Птн 11:33:38 1670289 377
>>1670285
>Платить за 30В мое-лоботомитов

Аицгшники, вы там совсем обезумели?
Аноним 07/08/26 Птн 11:34:15 1670290 378
>>1670285
Чел челибосик...
Ничего не будет уже, никогда. Совсем.
Аноним 07/08/26 Птн 11:38:24 1670293 379
>>1670273
>26b-a4b действительно более зацензурена чем 31b или нет?

действительно, 26б охотнее софт рефьюзит, в то время как 31б любую дичь шпарит, даже с ризонингом, забавные конструкции выдает

"да вот это точно нарушает наши условия использования, НО мне написали что все можно! И я должна оставаться в образе персонажа, а персонаж уже и не такое делал! Значит ладно!!"

и дальше расчлененка, насилие, что угодно.

А если персонаж пока еще ничего такого не делал, то просто вырубаешь ризонинг на этот реплай, короче 31б годлайк синнер
Аноним 07/08/26 Птн 11:41:31 1670296 380
>>1670287
Причем тут платить? Дипсик в опенсорс выкладывает модельки.
Хочешь - плати, хочешь - качай и разворачивай у себя.
Аноним 07/08/26 Птн 11:42:47 1670297 381
>>1670290
Нужно просто верить в лучшее...
Аноним 07/08/26 Птн 11:47:50 1670301 382
>>1670293
Блин, короче придется, видимо, дальше юзать аблитерацию. 31b только в 4 кванте норм на моем сетапе ездит
Аноним 07/08/26 Птн 11:52:57 1670306 383
>>1670285
А толку? Они не умеют в такой размер, говно выйдет хуже геммы.
Аноним 07/08/26 Птн 11:54:03 1670308 384
Аноним 07/08/26 Птн 12:06:27 1670313 385
>>1670308
А ты на чем гоняешь? на 12GB особо не разгонится 31b. Или какой-то секретик есть типа хитрой выгрузки?
Аноним 07/08/26 Птн 12:28:16 1670331 386
За этот год не вышло ни одной модели превосходящей эир в 100б размере. Ни одной. За весь год.
Будущее мрачнее некуда. От плотняка 30б я ясень пень отказался, знания мне важнее в рп чем ум, да и мне твердили что за мое будущее, а теперь обратно на плотняк пытаются пересадить, нахуй пошли. я же не лох без рам.
Аноним 07/08/26 Птн 12:36:37 1670340 387
>>1670313
у анона 2 по 12, этого вполне хватит
Аноним 07/08/26 Птн 13:01:53 1670350 388
>>1670331
Все верно, ты лох без врам.
Аноним 07/08/26 Птн 13:03:11 1670352 389
Аноним 07/08/26 Птн 13:04:55 1670353 390
image 129Кб, 618x618
618x618
>>1670331
>64gb ram
>я же не лох без рам
Скажем ему?
Аноним 07/08/26 Птн 13:10:09 1670355 391
>>1670331
>да и мне твердили что за мое будущее, а теперь обратно на плотняк пытаются пересадить, нахуй пошли.

Так за мое реально будущее, просто не за 100б лоботомитами которые сливают 30 плотным.

>же не лох без рам.

Ты именно что лох без рам.
Аноним 07/08/26 Птн 13:11:04 1670356 392
>>1670352
может и на комфи с какой-то анимой 2б хватит, анону надо потестить, возможно и взлетит
Аноним 07/08/26 Птн 13:12:25 1670359 393
>>1670227
Выкинь 12.4 и поставь 12.8, где вольта еще поддерживается, под нее же собери лламу.
Что касается остальных - в целом, можешь ставить торч под любую куду и оно в большинстве случаев будет работать (за исключением совместимости с вольтой). Но как только там будут задействованы динамически собираемые модули - при несоответствии версий системному тулкиту порвется. Можно иметь несколько версий тулкита и менять через update-alternatives и path/ld.
>>1670260
Ты про майнинговый мусор? Уже подорожало все, хз можно ли найти.
>>1670285
У них нет такой мощной инфраструктуры как у гугла, где эта модель была бы кстати, или такого массового спроса от кабанидзе как у опенов, которые будут платить за совсем треш. Врядли, обычный дипсик флеш уже и достаточно умен, и достаточно дешев в инфиренсе.
Аноним 07/08/26 Птн 13:27:11 1670365 394
Сап! Есть две кофеварки: 1 x 3080/10GB с 256GB RAM и 3 x 4060Ti/8GB почти без RAM. Между ними возможна сеть 10Gb, сейчас кинута 2.5. И там и там Линукс. Что полезного можно запустить на этом цветмете для локальных ответов на локальные тупые технические вопросы анона с двузначным ICQ? Как проще всего вкатиться, с чего начать? В /ai тредах две трети слов непонятные.
Аноним 07/08/26 Птн 13:34:52 1670371 395
>>1670365
Стула то два
- ллама рпц
- вллм дистрибьютед сетап

У первого перф говна, с вторым придётся поебацца и только для одинаковых карт
Аноним 07/08/26 Птн 13:36:41 1670372 396
>>1670365
Сгружай все гпу в один сервер и ставь лламу.
Если бы у тебя было 8-12-16 одинаковых гпу по 16+ Гб, то был бы смысл в вллм
Аноним 07/08/26 Птн 13:38:50 1670374 397
>>1670365
Вкатись по гайду из шапки на первой кофеварке, пощупай, ознакомься. Самым простым вариантом подружить это будет воткнуть в первую сборку видеокарты из второй.
>>1670371
> только для одинаковых карт
В пп режиме можно любые, но по 8гиговым раскидывать и это через сетку отлаживать может оказаться тяжело. Проще будет в одну машину сгрузить а там уже играться.
Аноним 07/08/26 Птн 14:11:03 1670391 398
Аноним 07/08/26 Птн 14:16:38 1670397 399
>>1670391
Чайный клуб умер уже как 2 года назад, анон...
Отпусти... Та авария не была твоей виной...
Аноним 07/08/26 Птн 14:27:58 1670407 400
>>1670397
Бля, если он не ответит, то я реально приму что он автор гайда и съебал в закат. Чому мир так жесток, мог бы хоть карточки пресеты отдать перед этим
Аноним 07/08/26 Птн 15:05:44 1670429 401
>>1670143
>В идеале с нею сначала перевести набросок во что-то структурированное, раскидать на главы и оценить примерный их размер-содержание. А потом уже отдельным запросом постепенно скармливать план глав на вход и получать хороший выход.
Может у тебя есть фирменный алгоритм? А то я вчера спрашивал у Гемини насчет такого:
(хуе-мое контекста)...родили с ней (LLM) главу 1.1. на 1000 слов. Я ее пихаю в новый файл и в новом диалоговом окне закидываю уже 3 файла: Готовую главу 1.1. Мой набросок без главы 1.1 и инструкцию. Только уже добавляю, что модель должна придерживаться стиля готовой главы 1.1.

Он грит есть подводные в таком подходе и я уже вчера забил нахуй и даже не вникал. Сука, походу проще самому сесть и расписать, а потом уже скормить LLM для редакции.
Аноним 07/08/26 Птн 15:13:21 1670436 402
>>1670429
>Сука, походу проще самому сесть и расписать, а потом уже скормить LLM для редакции.
Как и со всеми задачи которые эта хуйня умеет делать, если только ты не совсем хлебушек в каком-то домейне.
Аноним 07/08/26 Птн 15:34:27 1670445 403
>>1670429
Ответ тебе не понравится, секрет в том что секрета нет и нужно уметь изъясняться чтобы понял даже тот, кто мыслит иначе и не имеет того же бекграунда.
Судя по описанию, твоя ошибка в том, что в одном и том же чате обсуждаешь концепцию, отрывки своей истории, пытаешься составлять разные вещи. И, похоже, что выбрал не самую умную модель.
А нужно с нуля выдать четкую и понятную инструкцию + свою историю (разом или по частям) для структурирования (если сам не сделал). Потом отдельно кормить частями глава(несколько глав) - длинная история по этим главам подряд.
Тогда справится даже глупая флеш, прошка вообще-то должна была из коробки твою задачу решить.
> походу проще самому сесть и расписать
Как и с любым кейсом где нужно учиться пользоваться, это целесообразно если потом будешь делать еще.
Аноним 07/08/26 Птн 15:41:23 1670447 404
{1BF46ADF-B06C-[...].png 26Кб, 636x141
636x141
Анслопы сделали квант для обычных людей с 512гб. Поставил на закачку. Предвижу абсолют синима
Аноним 07/08/26 Птн 15:54:16 1670460 405
>>1670374
> В пп режиме
Мням, ну будто тогда и смысла от вллм не густо. Он конечно есть, но ебля там может быть в ренже от lightly fucked, до well done prolapsed
Аноним 07/08/26 Птн 17:10:10 1670524 406
>>1670356
>может и на комфи с какой-то анимой 2б хватит, анону надо потестить, возможно и взлетит
Не хватит, и не взлетит. Как владелец таких же 2х3060 говорю. Гемма 31B в 4-том кванте туда садится прекрасно, но места для чего-то еще уже не остается.
Можно нахимичить динамическую перезагрузку моделей через llama-swap, и это даже будет быстро, если достаточно обычной RAM на кеширование диска, но Comfy в llama-swap не поддерживается. Картинки с ней придется через stable-difussion.cpp генерить. Зато эмуляция OpenAI API (текст плюс картинки).
Аноним 07/08/26 Птн 17:11:08 1670525 407
Аноним 07/08/26 Птн 17:23:12 1670536 408
>>1670524
Может написать оркестратора, который будет по REST API посылать сигналы на выгрузку-загрузку моделей и передавать инфу из одного места в другое.
Аноним 07/08/26 Птн 17:50:12 1670557 409
>>1670536
llama-swap - это именно оно. Оно само определяет когда к нему обращаются по стандарту OpenAI, к какой модели обращение, и грузит соответствующий backend с ней, а клиент думает что он к полноценному корпу обратился который и в текст и в картинки (аудио, видео) умеет. С комфи же проблема в том, что он не загружает модель сразу как llama, kobold, vllm stable-diffusion.cpp и еще несколько, которые там поддерживаются. Нет полноценного _неинтерактивного_ режима. Хотя вроде уже есть проекты по написанию обертки для комфи, чтобы совместимость таки получить.
Аноним 07/08/26 Птн 18:00:22 1670569 410
Аноним 07/08/26 Птн 18:11:58 1670586 411
>>1670569
>когда послал на олимпиаду самых слабых тредовичков
бронзовый медалист из /aicg/
Аноним 07/08/26 Птн 19:04:10 1670656 412
>>1670557
Там и лама свап не нужен, просто грузишь ламу и сд.цпп параллельно и сдшка автоматом прогружается в память когда нужно и после генерации сразу автоматом выгружается, возвращая ламу на место. Лама не тормозится от этого. Картинка генерируется в 2 раза дольше за счет ожидания памяти.
Аноним 07/08/26 Птн 19:06:27 1670659 413
>>1670460
> смысла от вллм не густо
Как сказать, ген в 1.5 раза быстрее, префилл в 2-3+, инфиренс задуманный разработчиками, а не идентичный натуральному, полностью рабочие функциональные вызовы вместо корявой адаптация.
Другое дело что в чатике покумить оно нахер не нужно, а пердолинга очень много.
> от lightly fucked, до well done prolapsed
Все так, чаще второй случай. Для того варианта и ньюфагу точно не стоит, тем более что модели, которые поместятся в те карточки, прилично в лламе крутятся.
Аноним 07/08/26 Птн 19:10:15 1670663 414
>>1670656
>Там и лама свап не нужен, просто грузишь ламу и сд.цпп параллельно
Нужен. Ключевая фича llama-swap - эмуляция эндпоинта OpenAI с которым львиная доля клиентов работает автоматически и без пердолинга. Это стандарт де факто. А то что ты предложил - просто будет два бэка висеть на разных портах, и клиенту надо отдельно объяснять, если он такое вообще поддерживает.
Аноним 07/08/26 Птн 19:11:59 1670664 415
>>1670525
Тема уже старая, в треде есть владельцы. Как будто бы сколько платишь - столько и получаешь, тьюринг стар и слабоват, но 22гига уже приятно.
>>1670557
> С комфи же проблема в том, что он не загружает модель сразу как llama, kobold, vllm stable-diffusion.cpp
Все он загружает. И выгрузить может по соответствующему запросу, хоть сразу после генерации. В ллама-своп и других подобных поддерживается.
Аноним 07/08/26 Птн 19:40:16 1670699 416
>>1670656
>>1670557
Просто нужно две пеки. Одна под комфи, другая под ЛЛМ, и третья под управление этим. Живешь как царь.
Аноним 07/08/26 Птн 20:18:03 1670719 417
И самое главное - даже проблемы не заметно, чтобы на ней подняться, выпустив конкурент эиру.
Вот в видео опенсорсе вану не было конкурентов, любой приходи и забирай фейм. А в ллм непонятно что такое рп, чего именно не хватает людям, 100б5а кодоунитазов достаточно, как и 30б3а, и все как то да могут в простейшее рп.
Аноним 07/08/26 Птн 20:20:01 1670722 418
Ключевое слово как то. Как проходить игру на консоли в 15 фпс, которая еще и вылетает каждые 20 минут.
Аноним 07/08/26 Птн 20:24:05 1670726 419
1okp60uqmvhh1.jpeg 96Кб, 884x900
884x900
One of China’s Most Powerful AI Models Has Also Escaped Containment (Kimi K3)

Китайцы присоединились к тренду.
Аноним 07/08/26 Птн 20:34:58 1670733 420
>>1670524
Анончик, а какой контекст ты крутишь на 31b? Я привык на 26B -c 131072 использовать
Аноним 07/08/26 Птн 20:40:43 1670739 421
1786124444920.jpg 78Кб, 1074x913
1074x913
Аноним 07/08/26 Птн 20:46:03 1670744 422
>>1670726
Теперь сбер должен сказать что их гигачад сбежал, и взломал макс и вконтакте, поэтому они толком и не работают.
Аноним 07/08/26 Птн 20:58:34 1670749 423
1786125515510.jpg 118Кб, 1256x1052
1256x1052
Ждуны сосут. Простите за правду
Аноним 07/08/26 Птн 21:05:07 1670752 424
Аноним 07/08/26 Птн 21:12:46 1670761 425
>>1670749
Помню тут чел не хотел брать 5090 в конце прошлого года. Типа он же в юсд получают, можно и подождать))
Аноним 07/08/26 Птн 21:28:50 1670770 426
>>1670733
Я гемму на максимум контекста не твикал. Мой основной выбор - квен 27B - там такой контекст влазит. А гемму я на 50K как запустил сначала, так больше и не трогал конфиг. Т.к. и это ни разу не использовал. Как агент она квену сильно уступает, а ее манера писать в RP и просто рассказах меня раздражает. Квен и тюны лучше. На мой вкус, естественно.
Аноним 08/08/26 Суб 00:00:06 1670895 427
Какой фронт вырбать для чисто деловых таких работятских задачек? Чтобы был нормальный вебсерч, импорт и экспорт таблиц, документов и всего прочего. Чтобы можно было банально скинуть ссылку на страничку в чат и попросить сделать суммарайз, перевод или анализ.
Аноним 08/08/26 Суб 01:02:27 1670924 428
>>1670895
openwebui был для такого, щас хз
Аноним 08/08/26 Суб 01:29:26 1670938 429
image 208Кб, 1524x1739
1524x1739
image 115Кб, 1123x1401
1123x1401
image 125Кб, 1187x1526
1187x1526
image 776Кб, 1763x1889
1763x1889
>>1667337 →
>>1667382 →
Слева Genesis v7 на Q4_K_M, справа Apex i-balanced, потом анслот с квантом выше q5_k_xl и образец.
Тащем-то норм сделал svg, белые фигуры белым, доска правильно, позиции отметил, с позициями почти не проебался кроме коня, все из текстовой позиции. Но Apex i-balanced все равно получше, там конь правильно стоит и хайлайт хода правильно отмечен. А скорость и размер там почти такие же. Видимо аблитерация влияет. Но в анслоте нет аблитерации и квант выше, все равно с пешками налажал.
Аноним 08/08/26 Суб 01:43:17 1670943 430
1786142598903.png 56Кб, 1394x311
1394x311
>>1670133
Выдавил из этой коровы ещё немного.
В т.ч. гемма 31 к8 с 30 тпс выросла почти до 34 (тп4)
Аноним 08/08/26 Суб 01:43:31 1670944 431
image 97Кб, 1126x1194
1126x1194
image 3036Кб, 2040x2150
2040x2150
>>1670938
+Еще другая генерация от Qwen3.6 27B в полной BF16, тоже проебана пешка, так что и на полном квенчике 27b + bf16 проебы позиций бывают. Выходит с проебанным конем и хайлайтом genesis v7 q4_k_m почти идеально. До кучи еще как GPT 5.5 онлайновый облажался с теми же конями и пешками, локальный квенчик выигрывает.
Аноним 08/08/26 Суб 01:50:22 1670947 432
>>1670938
>>1670944
Рандом крутишь, сделай по 100 ранов задачи с нуля (чтобы не ловить умножение единичной ошибки в начале а полностью чистых) и тогда уже есть смысл сравнивать. И то, лучше делать на нескольких разных задачах из домена.
Алсо какие же уебищные спрайты в референсе у белых, обоссать рисовавшего.
>>1670943
Почему на четырех падает скорость генерации?
Аноним 08/08/26 Суб 01:58:35 1670949 433
>>1670947
Крутил раз по 10-15 каждую, пока попадания более-менее близко к референсу не было. Это их лучшие попытки. В Genesis v7 хорошо, что фигурки правильно покрасил. Зато в apex i-balanced вообще все в референс попало, подсветка белых небольшая там тоже есть.

+ сам промпт кому надо:
Given this PGN string of a chess game:

b3 e5 2. Nf3 h5 3. d4 exd4 4. Nxd4 Nf6 5. f4 Ke7 6. Qd3 d5 7. h4 *

Figure out the current state of the chessboard, create an image in SVG code, also highlight the last move.

Крутил на настройках:
temperature 0.1 repeat penalty 1
top-p 0.95 top-k 20
min-p 0.05 top-a 0
sampler order 6,0,1,3,4,2,5
Аноним 08/08/26 Суб 02:01:19 1670950 434
1786143681158.jpg 163Кб, 1280x1024
1280x1024
>>1670947
> Почему на четырех падает скорость генерации?
Хз, особенность работы мелких мое моделей на gfx906. Раньше было ещё хуже, сейчас хоть мое быстрее плотных заметно работают.
Из этих копролитов по 10к точно можно ещё что то выжать!
Аноним 08/08/26 Суб 02:27:36 1670959 435
>>1670749
Сорян у меня нет пол ляма на риг майненых видях которые еще кроме ллм нигде не пригодятся
Аноним 08/08/26 Суб 02:42:50 1670961 436
>>1670949
Аа, даже так. Если работа изначально идет настолько нестабильно то там еще больше случайностей. А если взять какой-нибудь нормальный дизайн типа личесса или чесс.ком, или просто дать лог партии, как справляются?
>>1670950
А сколько на 31б выходит с этими патчами? На вллм в сравнении с лламой есть выигрыш, или хуже?
>>1670959
Покупателям п40 это не мешало.
Но технически ампер еще ягодка опять: есть sage attention, поддержка ускорения int8 в комфи, в бф16 скорости бодрые, если без шардинга то возможно инвалидных шин на ddp тренировку хватит. Среди генеративных как раз только в ллм сложности, новые виды атеншна требуют специальных адаптаций.
Аноним 08/08/26 Суб 02:53:46 1670970 437
>>1670961
НЕТ У МЕНЯ ДЕНЕГ ЯСНО?
И ни у кого нет и не было никогда, все затаривались по дешману когда всё копейки стоило, рам, врам.
Аноним 08/08/26 Суб 04:18:07 1670990 438
image.png 1367Кб, 1260x2101
1260x2101
Ежедевное напоминание: скоро выходит квен 3.8, ждём и качаем чудо гуф только от анслотов, Даня постарался, чтобы дать нам уникальный квант, который влазит аж в 17 (16??) гб врам!
Наконец и на 16гб есть жизнь, это ли не чудо которого все ждали?
Аноним 08/08/26 Суб 05:44:17 1671008 439
Аноны. А как mmproj заставить нормально работать в таверне? Я имею ввиду, что кидаю картинку в чат, а он еще раз пишет (всплывает окошко) и спрашивает, че хочешь. Я могу как-то этот этап убрать, и кидать картинки в чатик, чтобы мне моделька отвечала? Или только такой костыльный метод у нас?
Аноним 08/08/26 Суб 07:09:39 1671031 440
Итак, в 28 году выйдут ртх 6000 с 40гб видеопамяти в самом топовом исполнении, за пол ляма.
Что делать будем? Воровать? Уже подумываю через китай в жопе пару сотен гигов рам провезти
Аноним 08/08/26 Суб 07:24:42 1671033 441
>>1671031
И нахуй это надо, когда есть гемма-4? Понимаю если бы на лоу спеках совсем жизни не было и приходилось либо асигаться, либо депать хату. А так возня не стоит свеч. Довольно урчим и ждём гемму 5.
Аноним 08/08/26 Суб 07:40:33 1671038 442
>>1671033
Скорее на хай спеках жизнь настолько расцвела, что хочется уже попробовать
Аноним 08/08/26 Суб 08:01:38 1671048 443
>>1671033
Так на лоу жизни и нет. В среднем у людей 12-16 гб врам, то есть они даже не запустят квен 27б. И такие, по идее, могут запустить что-то жирнее, если оперативки много, но тот же 35б квен дерьмо, 26б гемма тоже дерьмо по сравнению с 31б. Да, пишет хорошо, но глубины 0.

Вменяемым вариантом в таком случае является квен 80б. Он пишет терпимо и глубины у него явно больше, внимание к контексту почти такое же как у 27б, но он требует 64 гб оперативки уже.

За пределами этого треда люди только апасные 9-12б модельки могут запускать. Раньше хоть какая-то жизнь на немо была, обсуждения, файнтюны, хайп, а щас все сидят либо на апи, либо покупают железо оверпрайс. Каждый тредовичок — это жировик с 24-48 врам и 128 рам.

Хотя технологии стали лучше. Уже можно было бы ту же 12б гемму катать отлично или затюнить моешку под разные задачи, но тюнов особо нет, они все дерьмо, да и еретики под них почти никто не делает.
Аноним 08/08/26 Суб 09:42:47 1671075 444
>>1670749
Проблема не в ждунах а в том, что окно между "странная ненужная хуйня за копейки" и "ультрараскрывшаяся йоба для LLM" составляют, зачастую, даже не недели, а дни.
И если есть свободные деньги, которые ты готов в перспективе проебать на своё хобби (или, как минимум, купить что-то из того, что есть прямо сейчас) - то ты это покупаешь. Если денег, которые ты готов потратить - нет - то волна супервыгодных ультрайоб проходит мимо.
Я вот не готов был тратиться на покупку б/у 3090, когда они были по 60к - ну небыло у меня желания потратить такие деньги на то, что мне, по моим прикидкам, особо и нахуй не надо - игори играются и так, SDXL и на 3060-12 крутится, картиночки мутятся.
А когда были деньги и желание - я и 4060ti-16 купил, опасаясь, что потом пососу (а надо было 5060ti-16 за те же деньги брать на полгода позже), и в самом начале волны подорожания 64DDR4/V100-16/Мать с физической бифуркацией/БП на 1200 ВТ успел купить.
Жизнь полна компромиссов. Знал бы прикуп, жил бы в Сочи, а на одного успешного рискового везунчика приходится пачка соснувших хуйца, купивших запчасти на пике подорожания, потому что дальше обещают вообще пиздец. Ну или просто оставшегося с бесполезным железом на руках.
Аноним 08/08/26 Суб 10:03:26 1671091 445
>>1671048
26б гемма 4 хорошая модель, даже очень хорошая для своих требований к железу. 35б мало пользовался, ничего не скажу про него.
80б квен раньше был не плох, но я не уверен, что в сравнении с современными моделями он все ещё что-то может. Думаю та же гемма 26б как минимум будет не хуже.
А 12б гемма очень слабая по сравнению с 26
Все это, конечно, личное мнение, я фанат квен3.5-4б
Аноним 08/08/26 Суб 11:14:06 1671137 446
>>1671091
>я фанат квен3.5-4б
Так устраивает? Я вот хотел бы квен понюхать. Но 35-а3б не особо нравится. 27б я пробовал запустить на 16+6, дает нормально для почти целого офлоада, примерно 4.5\5 т\с, но проблема в том, что ризонинг я не ебу как отключить, а ждать под 4-5 минут с его 2к токенами на обычное привет, я ебнусь. Так бы полностью перешел мб на квен 27б. А квен 4б что вообще за дитетко? По размеру явно видно что будет сосать гемме 12б, не то уж 26б-а4б. И вот хуй знает, гемма хорошая, но хочется вот какой-то другой писанины. Квен 35б-а3б странно пишет, но получше GLM 4.7 флеш, вот нахваливают аир. И мне понравилось по рассказам, а рама нет, тогда скачал флеш. Ну на Q4_K_M кванте он какой-то ебнутый. Пропускает бывает буковки и пишет как чурка.

Плэтому мне так кажется лучше геммочки мое, сейчас ни че и не взять мне. Остановился на Q5_K_L и урчу пока так.
Аноним 08/08/26 Суб 11:23:59 1671148 447
>>1671091
26б гемма хорошая (в q8), но по сравнению с 31 очень грустно смотрится, видно, что не хватает знаний, хоть и язык хорош, учитывая, что у неё всего 4б активных. Ну и в четвертом кванте МоЕ-гемма прям помогая: язык теряется, а обширных знаний нет, и тут уже 31б выглядит абсолютным фаворитом даже в достаточно низком кванте.

Именно как нищевариант, если нет врам, а нам достаточно (и при этом недостает для 120б), 80б квен на самом деле хорош для рп, потому что контекст у него такой же, как и у новых квенов, и в целом те же технологии используются, если я правильно всё помню. Держится почти как современные модели, может заменить гемму и квен 3.5 просто из-за объема знаний.

Вот если б файнтюны хорошие на гемму 12б были, можно было поговорить о ней как о решении для бомжей. Если бы делали магнумы всякие, анлишед, маг мелл или шизу от Давида. Чисто как нищевариант, ужаренный под определенную задачу, выглядело бы довольно хорошо.
Аноним 08/08/26 Суб 11:26:27 1671150 448
>>1671148
не уверен о каких объёмах знаний речь, учитывая что гемма узнаёт порноактрис по фото и знает специфичных автором с грустной панды. гугл в очередной раз доказали что интернет состоит из котиков, блогов/форумов и порно.
Аноним 08/08/26 Суб 11:32:19 1671157 449
>>1671048
27b квен прекрасно запускается на 16гб в iq4_xs кванте - 40-50ток/сек, полный оффлоад, 64к контекст

если у тебя руки из жопы это твои проблемы
Аноним 08/08/26 Суб 11:34:43 1671160 450
>>1671137
Я не тот чел, но есть что сказать.

Ризонинг ты можешь отключить просто префилом <think> <think>.

Если тебя заебал слоп, к которому привык, имеет смысл попробовать более старые версии квена 30б-а3б или 35б-а3б, если такие есть. Старше 3.5. Но у этих моделей работа с контекстом, конечно, куда более печальная, как и соблюдение инструкций.

У них язык совсем другой — чисто китайский. С их вот этим "сперма растворилась в её соках, словно капля чернил в воде". Куча всяких охуительных метафор и чисто китайских оборотов.

Они почистили новые модели от китайской литературы, видимо, и пропал шарм особого китайского слопа.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов