Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
Из этого я взял лору Лайт2х лору от Киджая (ужатую), 8 (7) шагов euler beta, Sol, и получается заебато, конечно. Спектрум, как мне показалось, толком тут уже не работает, пропуск 1-2 шагов погоды не делает, ИМХО. Сажа включена по умолчанию, флагом в sh, что ты мне сделаешь.
Я хз как вы смотрите, турбо лора реально не даёт слоумо и следует промпту так же эффективно, выполняя порядок действий на протяжени 15 секунд, что и ориг, при этом прирост от х3 до х5, и это самая первая сырая версия.
блядь как же я заебался заставить сэйдж работать, куда обновил, колесо прикрутил, всё пишет что работает, а на ноде всегда ошибка вылезает. 6 часов убил на эту хуйню
>>1670688 бле ананас, спектрум то работает, не кто не спорит и время уменьшается, но ты прикинь если у тебя под турбо лорой из 6 шагов, полноценных только 3
это на обычной генерации скип еще компенсируется, на турбе это сразу деградация картинки
>>1670698 Его можно в comfy подключить, ёбаный рот, какие вы все однобокие экспериментаторы хуевы, только циферки дрочить в готовых инструментах можете.
Ну я сравнил ориг + ртх + дено. Дено действительно мылит, но на ртх без дено видно увеличенные артефакты, короче, ну чу-у-у-уточку лучше с ртх и еще чу-у-у-уточку лучше с дено => ртх. Но за 2,5 секунды как будто и даром. Надо тестить мелкие разрешения теперь.
Как же r2v ебёт это просто сказка! Я охуел. Тут даже лоры не нужны. Единственный минус - звуковые эффекты. Но по идее и их можно пофиксить через прикрепляемое аудио.
>>1670751 Двачую. Вообще реф это монстр. Вот я взял лору, сгенерил хенджоб. А там вместо пениса бодихоррор. Ну я думал подождать лору сначала, а потом вспомнил про реф моделку. По итогу в качестве рефа дал рандомную пикчу пениса и вообще отлично вышло.
>>1670741 На. Я все прошлые выходные пытался соединить эти две картинки в одну, нихуя не выходило либо выходило криво. А вчера с первой попытки сделал видеорил, именно то что мен нужно. Хотел пикчу, а получил видос в 1080 рублей. Кадр с тележкйо тоже заебался делать, ван её все время двигал, чтобы я ему не говорил. Эйч три с первого раза взял нужный ракурс.
Пытаюсь использовать две картинки с персонажами и видео в качестве референса их движений (типа, чтобы два моих персонажа танцевали как на видео). Но в итоге каждый раз получаю тупо видео ряд из референсного видео. Вроде бы всё делаю, как в гайде написано. Мой промпт: subject_definitions: <Subject 1> is the woman from <Picture 0> dancing like in a <Video 0> <Subject 2> is the man from <Picture 1> dancing like in a <Video 0>
summary: [reference generation] The target video is a dark scene where <Subject 1> and <Subject 2> dancing like in a <Video 0>.
detailed_description: The target video is in a realistic, documentary style with natural lighting and a static camera. [Shot 1] The video opens with <Subject 1> which dances with <Subject 2>. <Subject 1> and <Subject 2> smiles. Static camera.
overall_soundscape: Quiet street noise can be heard on the background.
non_diegetic_music: A romantic melody plays in the background.
Пробовал исправлять с помощью DeepSeek - результат тот же. Использую стандартный воркфлоу из темплейтов для ref2va.
>>1670863 Прогони референесное видео через DWPose или Depth Anything.
Есть еще одна мутная тема с размерам референса. По ощущениям если он совпадает с конечным разрешением, то больше шансов, что модель его затянет как есть в кадр и наоборот.
Какой положняк по двум турболорам? И как использовать первую в стандартном лоадере - ругается миллионом сообщений вида [WARNING] lora key not loaded: blocks.39.adaln_proj.linear.lora_A.weight
>>1670850 У меня ref2va на 5060ti 16 gb (+ 80 gb RAM) с одной картинкой-референсом на модели int8 c 16 шагами 5 секунд видео 1280 x 736 на дефолтном воркфлоу генерится примерно 15-16 минут
Охуел конечно, как оно легко с камерой работает, представляя те же объекты со всех возможных ракурсов. И это на голом ворке из комфи. Надо обмазаться по полной.
>>1670914 в теории если турбу ебашишь то аудио надо на 6 выкрутить при 4-8 шагах, по умолчанию и так 12 и 3 используются и только увеличиваешь время генерации из-за лишнего патча
бля какой подгон сделали китайцы конеш, хуй представишь что какой то ван или лтх могли бы сделать хоть чтото похожее. без всяких лор на стоковой модели. Пиздец конеш базированые китайцы, правда походу над было ставить побольше секунд, а то они прям зарашили. Но вот вернулось то что умерло с лтх, а именно кайф в придумывании промптов всяких так еще и качество как будто ты корпу юзаешь, ток бесплатно и без цензуры
>>1670918 -> >>1668830 → >Но если по картинке с референсом модель не сделает рол с каким нибудь иллитидом сосущем ебушем рот тянки, то выкладывать рил будет нечего, ван с лорами останется на пьедестале. Ну и как, ван всё ещё на пьедестале?
>>1670926 Но у LTX всё же звук получше будет. Я хоть и тоже в восторге от китайцев, но расстроен из за того что вместо минутных LTX видосов моя система едва способна на видосы в 15-20-сек в лоу резоолюшене, какой то дауншифтинг или очередная заявка на полумилионный апгрейд системы :( Также не совсем понял почему Ref2VA по одной пикче генерит результирующее видео раз в 10 дольше чем FL2VA, того же разрешения и той же длительности.
>>1670993 ну кстати чтобы чисто прогнать посмотреть как промпт будет работать можно вообще все ускорялки включить, результат будет кал но что то видно будет
Что-то этот RTX super reso слишком дофига памяти жрет. Пару раз проскочило по 300 сек, а после уже на 2-3 минуты дольше, потому что на его этапе память забивается на 99-100% (32 + 100 подкачки). А еще как отключить сохранение аж двух результатов, с аудио и без? Жестак тоже не резиновый...
Турбо лора ускорила мою фигню почти в 2 раза, но как-то без восторгов. Есть подводные, да и r2v мимо, а это главный режим. r2v для годноты, i2v для порнухи, t2v для хуйни. Лучше бы только годноту ускорила.
>>1671011 У мивимекса проблем с сосанием нет (как в принципе с погружением твердого хуя в любую дыру, коей рот и является. Есть проблема с режиссированнием сосания, надо все посекундно расписывать, иначе как во всех 5+ сек генераторах нейронка лениться и забивает хрон однотипным примитивным повторяющимся действием. То есть, так и пишешь [0-3c) заглотила хуй [3-6c) вытащила изо рта облизала [6-9c) снова заглотила подрочила себе на лицо хз че там у тебя, у мамки своей спроси она распишет детальней.
То что выше писали про звуки сосания, там надо подбирать правильные прилагательные просто "гаггинг" даст звук кашля похожий на звук пилы по дереву, звук сосания часто включает режим пылесоса. Но даже с правильными прилагательными прилагательными иногда происходит отвал и звук сильно искажается превращаясь в хруст, я так понял это какой-то косяк самого мивимекса на специфическом контексте.
Те кто пишут, что минисракс не тренировали на порно - долбоебы. Он прекрасно знает теги порнофильм и т.д. То что там гениталии попердолены, так это проблема всех нейронок с первого дня, даже объяснять лень тупоголовым хлебушкам. Гениталии так же точно попердолены и у корпов, и пездояйца грока и хуи бабские все это видели все на гроке, сидримсе и так далее, везде где был отвал цензуры. Наоборот, в отличии от ван22, искоропки мивимекс генерит стабильно какой-никакой но хуеподобный отросток, а не деревянную палку или еще какой треш. Там даже головка и яйки в наличии. Это всё тюны/лоры, но даже сейчас легко купируется и2в с нормальным хуем на картинке, после вынимания его откуда угодно он в 70% даже форму головки держит.
По факту, все остальные лтксы (прости господи, искренне жаль тех кто вообще зарился на эту парашу ебаную), ваны и так далее можно удалять нахуй.
>>1671015 не у всех женщин брухля с выпадающим клитором, это индивидуально. бугорок, конечно, скорее всего, должен быть виден, но можно сослаться на то, что ноги прижаты вместе.
>>1671014 Если ты там здорово наебался с сосательным промптом, мож поделишься? Неохота шишки самому набивать По поводу аудио тут советовали взять реф, надо попробовать взять секунд 10 с прона и с каким нибудь partially_copy/reference запихнуть в промпт
>>1671015 прикинь, инцелишка, в реале клитор не болтается как хуй. модератор, тут 24-летнее тело, просто с сиськами и сложением не повезло, не триггерись плез.
>>1671016 Не знаю, как-то неестественно выглядит все равно, намек на наличие клитора в верхней части щелки (особенно настолько высоко поднятой) все равно должен быть. можешь перефорсить и сказать, что клитор это маленький хуй, а хуям не место в генерации тяночек
>>1671017 А если в реф крупный план сунуть и в смене кадра сослаться на него?
Вот вам идейка для теста - не просто зеркало, а ещё и "sharp shadows on the wall". На некоторых настройках отражённые тени своей жизнью жить начинают =)
>>1671018 >Если ты там здорово наебался с сосательным промптом, мож поделишься? Не могу скинуть по очевидным причинам. Но я не писал сам с нуля, ты можешь просто адоптировать готовые вановские простыни которые в нф часто кидают, либо используя промпт для агента сделать в любой нейронке, дипсик например.
>По поводу аудио тут советовали взять реф, Тут в треде половина видосов с прегенерированными рефами на звук, так что оно норм сработает. Так же если тебе нужны крупные планы, то ты можешь как в стандартном примере с бабой на парковке - сделать просто серию картинкорефов из сосания.
Блять, а нахуй в дефолтной ноде энкодинга в Комфи они энкодят референсы и через текстовый энкодер? Если отрубить этот говняк, то лица лучше с референсов копирует и лоры не перебивает так сильно. Просто бесполезное размытие эмбединга мусором, когда у нас референс без проблем VAE энкодится.
>>1671056 >Если отрубить этот говняк, то лица лучше с референсов копирует и лоры не перебивает так сильно. В смысле? Нод ошибку же выдавать будет если клип отключить. Можешь показать как сделал?
>>1671084 >>1671085 Бля анон спиздел, я её забыл подключить лол, это на 6 шагах без лоры даже. Вообще лора minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy.safetensors
Где там гпу лучше арендовать, чтобы без пердолинга можно было бахнуть свой вф из комфи? Хочу локально экспериментировать и закидывать чисто на рендеринг в хорошем качестве.
>>1670846 На 5070 ti 640х480 (читай 1280х960) ты уже за минуту увидишь, там 56-62 сек генерируется. Текнолоджи. Но хорошо, что тае выпустили, у кого видяшки послабее.
>>1670850 Без апскейла — да, но коротенькие и долго.
>>1670863 Мне нейронка хуярит эти тексты и збс получается в рефе.
>>1670898 Первая так себе, вроде норм, но лайтх2в топчик, но с весом 0.5 обязательно.
>>1670935 Две совершенно разные архитектуры. У ЛТХ всегда были realtime видео на 4090/5090. В этом их фишка. И контекст милипиздрический. Но качество такое себе. А тут раза в четыре дольше, ну, с апскейлом, раза в два дольше, и контекст толстенький, влезает меньше. Да и апскейл не латентный, а растровый. НО ТЫ ПОПРОБУЙ ЕГО СЛЕДОВАНИЕ ИНСТРУКЦИЯМ ТЫ ПОПРОБУЙ ЕГО РЕФЕРЕНС ТУ ВИДЕО АУДИО Не пихай видео, чтобы не работало долго, а чисто картинка + голос опционально, для скорости. Оно ебет мощнейше (хотя голос не идеально воис-клонит).
А цензуры и знание персонажей и знаменитостей? Пишешь кого хочешь — и оно с 50% знает кто это и рисует сам, так еще и озвучка близкими к оригиналу голосами.
>>1670992 6 степов: сажа по умолчанию, сол с 0.2 - 0.9, применяется для 3, 4, 5 шагов, пока все. Посмотрим седня, что за ферст блок кеш, а так тебе много не надо.
>>1670999 Эээ… У меня стабильно 1,5 сек на него тратится. И дено, и ориг. Я за 2,5 лишние секунды получаю х2 разрешение (мыльноватое правда, как х1.5 считай).
>>1671067 Какой-то бредогенератор. Какое ещё понимание движения, если референс статичный. Ну и на практике минусов не вижу если на референсе человек. Может несколько сложных референсов и будет проёбывать из-за отсутствия текстовых токенов.