Showing posts with label Stable Diffusion. Show all posts
Showing posts with label Stable Diffusion. Show all posts

Wednesday, 11 March 2026

Аудит символічних посилань.

Вітаю панове.

Раніше я вже писав про символічні посилання(symlink) і активно використовую їх у своїх проєктах. Це дуже зручний інструмент: один раз налаштував — і програми працюють з потрібними даними так, ніби вони знаходяться у стандартному місці. Так я, наприклад, викручуюсь з файлом extramodelpaths, щоб черговий апдейт ComfyUI не нищив мої посилання на теки з моделями.)

Але є один практичний нюанс - через деякий час починаєш забувати:

* де саме створені посилання

* на які каталоги вони вказують

* чи всі вони ще актуальні

Справа ще і в тому що неактуальне посилання НІЯК не сигналізує вам про те що воно посилається на теку якої вже не існує. Саме тому періодичний аудит символічних посилань стає корисною звичкою. Нижче коротко розберемо, що це таке, навіщо вони потрібні і як швидко перевірити їх на диску.


# Що таке символічне посилання для теки

У файловій системі NTFS, яка використовується в Microsoft Windows, символічне посилання — це спеціальний об’єкт, який містить шлях до іншої теки.

Наприклад:

C:\Project\data  →  D:\Storage\datasets

Коли програма відкриває папку `C:\Project\data`, фактично використовуються файли з `D:\Storage\datasets`.

Для більшості програм це виглядає як звичайна папка — різниця повністю прозора.


# Як створюється символічне посилання

У Windows це робиться через команду `mklink`.

Приклад:

mklink /D "C:\Project\data" "D:\Storage\datasets"

Після виконання команди:

* папка `data` виглядає як звичайний каталог

* всі операції виконуються у `D:\Storage\datasets`

Sunday, 22 February 2026

Кінець епохи "німого" AI та початок ери One-Man Studio

Привіт привіт.

Кінець епохи "німого" AI та початок ери One-Man Studio? Звісно, це про Seedance 2.0! 

Те, про що ми мріяли у 2010-му, стало реальністю у 2026-му. ByteDance випустили модель, яка змінює правила гри.

Двадцять п'ять років тому, у вересні 2010-го, я писав у цьому блозі про майбутнє, де межа між реальним актором і цифровим образом зникне, а виробництво кіно стане доступним для кожного, хто має ідею, а не тільки для тих, хто має бюджет студії Universal. Тоді це була смілива, майже наївна фантазія. Ми захоплювалися першими незграбними спробами CGI і вірили, що колись комп'ютер стане не просто інструментом монтажу, а повноцінним співавтором.

Сьогодні, з виходом Seedance 2.0, це перестає бути прогнозом і стає технічною специфікацією. Ми звикли до шаленого темпу прогресу AI, але цей реліз від ByteDance — це не просто "покращена версія" чи черговий апдейт. Це фундаментальний зсув архітектури, який перетворює генерацію відео з лотереї ("пощастить/не пощастить") на контрольований, інженерний та режисерський процес.

Під капотом: Чому це "Game Changer"

Досі більшість відео-моделей (згадайте ранні Sora, Kling або Runway) працювали за лінійним принципом: "текст -> німе відео". Ви отримували красиву картинку, але вона була "мертвою": без звуку, без синхронізації губ, а персонаж міг змінювати колір очей тричі за секунду. Всі ці проблеми вирішувалися милицями стороннього софту, перетворюючи творчість на пекло пост-продакшну.

Seedance 2.0 пропонує нову архітектуру — Dual-Stream Diffusion Transformer. Це технологічний стрибок, який об'єднує візуальний та аудіальний потоки в єдину нейронну мережу. Ось що це означає на практиці:

1. Мультимодальний "міксер" (All-round Reference)

Модель дозволяє завантажувати до 12 референсних файлів одночасно. Це дає неймовірну гранулярність контролю. Ви більше не боретеся з нейромережею, намагаючись підібрати слова. Ви просто даєте їй "інгредієнти":

  • Фото актора (щоб зафіксувати зовнішність, одяг, текстуру шкіри).
  • Відео з хореографією (щоб скопіювати специфіку руху, ходу, мову тіла).
  • Аудіо файл (щоб задати ритм монтажу, настрій музики або конкретний голос).
  • Текст (щоб описати сюжетні повороти та нюанси сцени).

Система розуміє пріоритети та ієрархію команд. Ви буквально кажете: "Зроби сцену, де персонаж із @image1 рухається з агресією як у @video1, але в стилі нуар, під звук @audio1". Це рівень режисури, якого індустрія чекала роками.

Wednesday, 28 January 2026

Онлайн сервіси для upscale.

Привіт.

Мені вірно зауважили що не "модно" зараз щось з ПЗ розгортати на своєму ПК, і не всім воно потрібно. Але потреба апскейлінгу може бути разовою, і логічно що вона краще спрацює онлайн. 

Але це не все, бо для разового апскейлу бажано робити це БЕЗ реєстрації будь де. 

То ж пропоную наступний перелік онлайн сервісів для апскейлу. І тут, як завжди, є нюанси.


Детальний розбір наведеного списку:

Працюють без реєстрації (найзручніші):

Upscale.media - найкращий варіант зі списку. Дозволяє завантажувати, збільшувати та завантажувати результат без жодних акаунтів.

ILoveIMG - дозволяє зробити апскейл без реєстрації, але має обмеження на кількість файлів підряд.

⚠️ Можна завантажити, але реєстрація знадобиться для завантаження результату:

ImgUpscaler - іноді дає зробити 1-2 фото безплатно, але дуже часто вимагає логін для скачування результату у високій якості.

Cutout.pro - зазвичай вимагає реєстрацію (або бали), щоб отримати результат без великого водяного знака.

Unblurimage.ai - часто просить створити акаунт після того, як ви вже завантажили фото.

Обов’язково вимагають реєстрацію:

Leonardo.ai - це потужна нейромережа, вхід тільки через Google/Email.

Picsart - без логіна ви навіть не зможете почати редагування.

Cloudinary - це професійний інструмент для розробників, потрібен акаунт.

Gigapixel AI - це взагалі платна програма для комп'ютера (Topaz Labs), їхній онлайн-сайт зазвичай просто рекламує софт або вимагає купівлі ліцензії.

Мій вердикт: 

якщо хочете максимально швидко і без «зайвих рухів», обирайте Upscale.media. Це єдиний сервіс зі списку, який справді цінує ваш час і не вимагає пошту.

Щасти.

Friday, 23 January 2026

Видеокурс Forge WebUi (КМБ).

Всем привет.

Ребята, сегодня хочу вам порекомендовать курс "FORGE WebUi (КМБ)" , который реально отличается от масс-маркета.

Сразу скажу: автор, Дмитрий Невский, не обещает «волшебную таблетку» или профессию за три дня. Это честное, живое обучение для тех, кто хочет реально разобраться, а не просто поиграться.

Многие думают, что учиться можно и по YouTube. Можно, но там каша. Автор этого курса в теме уже три года (еще с выхода самых первых нейросетей) и сгенерировал больше миллиона картинок. Он сделал этот продукт именно потому, что понял: людям не хватает структуры и глубины, а не просто разрозненных роликов.

Это не «рекламная вода», а концентрат его личного опыта. Курс проведет вас от базы Stable Diffusion 1.5 до всех наворотов Forge.

Главная фишка: вас научат не просто тыкать кнопки по шаблону, а понимать логику. Вы разберете интерфейс по винтикам и поймете, за что отвечает каждая настройка. Подойдет и новичкам, и тем, кто уже давно генерит, но хочет систематизировать знания.

Далее следует оригинал от Дмитрия Невского. Там же освещены ответы на финаносовые вопросы. Удaчи.

После того как вы оформите покупку вам откроется доступ ко всем уже вышедшим урокам и материалам к ним, а так же ссылка на чат в телеграме.


📖 КРАТКОЕ СОДЕРЖАНИЕ И ПРОГРАММА КУРСА

Курс организован на несколько блоков, где каждый блок будет содержать серию тематических уроков, позволяющих полностью освоить конкретную тему от А до Я.

1. Первый блок: осваиваем Forge с нуля. 

В нем мы детально разберём:

- Правильную установку Forge - все нюансы и подводные камни;

Разберем интерфейс "по косточкам":

- Назначение каждого окна и панели;

- Гибкую настройку рабочего пространства под свои нужды;

Ключевые параметры в Settings:

- Как каждый параметр влияет на генерацию;

- Какие настройки действительно стоит менять, а какие лучше не трогать;

- Оптимальные конфигурации для разных задач.

Вы поймёте не просто "где что находится", а научитесь осознанно работать с интерфейсом.

Tuesday, 20 January 2026

Вибираю Upscaler standalone.

Всім привіт.

Ми живемо в епоху, коли зіпсовану або просто маленьку фотографію більше не треба викидати у цифровий смітник. Штучний інтелект навчився домальовувати реальність, і робить це іноді лякаюче якісно. Але коли я почав заглиблюватися в тему локальних апскейлерів (програм для збільшення зображень, що працюють БЕЗ інтернету), я зрозумів одну річ: магія працює, тільки якщо ваш комп’ютер здатен її "перетравити".

Я протестував три абсолютно різні інструменти - від сучасних комбайнів до перевіреної класики - і ось мої висновки про те, кому і що варто встановлювати.

До речі - нижче всі три варіанти безкоштовні і всі три портабельні!

QualityScaler: Коли у вас є потужне "залізо" і бажання контролювати все

Якщо у вас стоїть сучасна відеокарта від NVIDIA (серії GTX або новіша RTX), то зупинятися на простих рішеннях - це злочин проти якості. Тут на сцену виходить QualityScaler.

Це не просто програма з однією кнопкою "Зробити красиво". Це справжня лабораторія. Головна його фішка в тому, що він використовує просунуті моделі (наприклад, BSRGAN або HAT), які вміють не просто згладжувати пікселі, а буквально "вигадувати" текстуру шкіри, тканини чи цегли там, де її не було. Окремо варто згадати функцію відновлення облич: якщо на старому груповому фото люди схожі на розмиті плями, QualityScaler через спеціальні алгоритми (CodeFormer) повертає їм очі та посмішки.

Він працює через DirectML, що дозволяє витиснути максимум з вашої відеокарти. Я навіть знайшов спосіб зробити з нього повністю портативну версію, яка живе на флешці разом з усім необхідним середовищем Python. Але будьте готові: це інструмент для ентузіастів. Купа налаштувань, повзунків і вибір моделей можуть налякати новачка, проте результат того вартий.

Tuesday, 13 January 2026

Як GenAI ламає зуби об дитячі розваги🧠💥

Привіт! 👋

Я вирішив влаштувати ШІ справжній іспит на "креативну гнучкість". Завдання були з розряду оптичних ілюзій та логічних розмальовок:

  • 3D Magic Eye (SIRDS) - стереограми.
  • Paint by Number - картини за номерами.
  • Парейдолія - приховані образи (наприклад, обличчя в хмарах в творах О. І. Шупляка - українського художника).

Спойлер: це було прикро. В якийсь момент ШІ навіть "чесно зізнався", що це завдання для нього занадто складне. Хоча в усіх трьох випадках він розумно і детально розкладав теорію створення іллюзії. Я розібрався, чому так сталося, і знайшов 3 фундаментальні причини, чому GenAI тут безсилий без сторонніх алгоритмів.

Ось чому магія не сталася "в один клік":

1. Конфлікт "Дифузія проти Математики" (Magic Eye) 📉

Стереограми (SIRDS) - це не малюнок, це чиста математика. Щоб око побачило 3D, пікселі патерну мають зміщуватися по горизонталі за жорсткою формулою залежно від карти глибини.

Чому ШІ провалився: генеративні моделі (Diffusion Models) навчені відновлювати зображення з шуму на основі візуальних патернів, а не математичних формул.

ШІ бачить мільйони стереограм у своєму датасеті, але для нього це просто "строкатий шум". Він не розуміє фізики паралаксу. Він генерує текстуру, схожу на стереограму, але оскільки пікселі не зміщені математично точно, 3D-ефекту немає. Це як намалювати QR-код від руки - виглядає схоже, але не працює.


2. Проблема Топології та Векторної Логіки (Paint by Number) 🔢

Розмальовка за номерами - це задача на топологію: замкнені контури, унікальні цифри для кожного кольору, відсутність "сміття".

Чому ШІ провалився: Нейромережі мислять пікселями, а не об'єктами. У них немає поняття "замкнений контур".

ШІ не тримає в "голові" глобальну карту кольорів. Тому він:

  1. Ставить цифру "5" на зону, яка має бути "1".
  2. Малює цифри, які не існують.
  3. Залишає розірвані лінії.

Для ШІ цифри на картинці - це просто частина візуального декору, як листя на дереві. Він не розуміє їхньої функціональної ролі як інструкції.


3. Обмеження "Уваги" та Буквалізм (парейдолія) 🗿

Парейдолія вимагає, щоб зображення працювало на двох рівнях одночасно: локально це скелі, глобально - обличчя.

Чому ШІ провалився: Сучасні моделі страждають від надмірної буквальності. Механізм Self-Attention (який відповідає за розуміння промпту) намагається максимально точно виконати запит.

Якщо попросити "приховане обличчя в горі", ШІ малює або просто гору, або відверту скульптуру обличчя. Йому важко знайти баланс "на межі фолу", де образ лише вгадується.

Без спеціальних "милиць" (типу ControlNet, який жорстко задає структуру, але дозволяє змінювати наповнення), звичайний промптинг тут безсилий. ШІ не вміє "мружитися" і фантазувати - він просто виконує наказ.


🏁 Висновок

Мій експеримент довів: GenAI - це художник-імпресіоніст, а не інженер-кресляр.

Він чудово малює суть і атмосферу. Але він ламається там, де потрібна піксельна точність (SIRDS), сувора логіка (Paint by Number) або подвійний сенс (Парейдолія). Поки що для цих задач ідеальний рецепт такий: ШІ генерує ідею -> Алгоритм/Людина доводить це до розуму.

А ви стикалися з задачами, де ШІ казав "я пас"? 👇

До речі, перші два кейси я залишив в своїй Pixel AI Studio, можете самі спробувати. 

#GenAI #ArtificialIntelligence #TechDeepDive #OpticalIllusions #MagicEye #SIRDS #AILimitations #TechArt

Friday, 5 December 2025

Hi, I'm Pixel AI Studio Pro!

Welcome to Pixel AI Studio Pro.

Версія: Pro (Hybrid Engine Update)

Дата виходу: 2026

Статус: Production Ready


1. ВИКОНАВЧЕ РЕЗЮМЕ

Нова версія Pro знаменує собою фундаментальну зміну в архітектурі мого додатку Pixel AI Studio. Продукт еволюціонував від інтерфейсу для генерації зображень (API Wrapper) до повноцінного гібридного графічного редактора.

Ключовою інновацією версії Pro є впровадження Hybrid Processing Pipeline, де можливості генеративного штучного інтелекту (Google Gemini/Imagen/Veo) поєднуються зі складними алгоритмами комп'ютерного зору (Computer Vision), що виконуються безпосередньо у браузері користувача. Це дозволило реалізувати функції, недоступні для звичайних ШІ-генераторів (стереограми, точні схеми, 3D-анімації).


2. КЛЮЧОВІ ІННОВАЦІЇ (ZERO-TO-ONE FEATURES)

У новій версії реалізовано модулі (стилі), яких не існувало в попередніх ітераціях.

Saturday, 8 November 2025

Екосистема CUDA.


Привіт усім! 

CUDA(англ. Compute Unified Device Architecture) - програмно-апаратна архітектура паралельних обчислень, яка дозволяє істотно збільшити обчислювальну продуктивність завдяки використанню графічних процесорів фірми Nvidia.

Щоб перевірити версію CUDA, яка встановлена на вашій ОС, ви можете скористатися утилітою nvidia-smi (NVIDIA System Management Interface).

Відкрийте термінал або командний рядок і введіть наступну команду:

nvidia-smi

У виводі ви побачите інформацію про ваші графічні процесори NVIDIA, а також версію драйвера CUDA, з яким вони сумісні. Це буде в рядку, що починається з "CUDA Version:".

Наприклад, вихлоп може виглядати так (це тільки перший рядок):

| NVIDIA-SMI 576.88   Driver Version: 576.88   CUDA Version: 12.9     |

У цьому прикладі бачимо версію CUDA - 12.9.

Якщо nvidia-smi не працює, це може означати, що драйвери NVIDIA не встановлені або встановлені неправильно.


Крім того, ви можете перевірити версію CUDA Toolkit (якщо він встановлений), використовуючи:

nvcc --version

Це покаже версію компілятора CUDA (nvcc), яка є частиною CUDA Toolkit.

nvcc: NVIDIA (R) Cuda compiler driver

Copyright (c) 2005-2025 NVIDIA Corporation

Built on Wed_Jan_15_19:38:46_Pacific_Standard_Time_2025

Cuda compilation tools, release 12.8, V12.8.61

Build cuda_12.8.r12.8/compiler.35404655_0

Thursday, 6 November 2025

JSON, XML та YAML

Всім привіт.

Самі популярні формати даних у ComfyUI: JSON, XML та YAML

Світ генеративних технологій сьогодні нагадує живу лабораторію, де експерименти з даними, форматами і налаштуваннями тривають безперервно. Кожен новий інтерфейс чи модель створює власну "мову спілкування" між користувачем і машиною. І хоча більшість з нас сприймає ComfyUI як просту візуальну оболонку для Stable Diffusion чи інших генераторів, насправді під капотом там живе ціла система форматів і правил.

Коли відкриваєш будь-який workflow або плагін у ComfyUI, можна натрапити на знайомі імена файлів - .json, .xml, .yaml. Спершу це дивує: навіщо три різні формати, якщо всі вони роблять приблизно одне й те саме - зберігають дані? Але за цим стоїть цікава логіка. Кожен із них не просто "формат", а окрема філософія - як саме програма має розуміти й передавати інформацію.


JSON - мова машинної точності

JSON - це формат, який у сучасному світі AI став стандартом де-факто. Його структура проста: фігурні дужки, коми, лапки - все чітко і передбачувано. Саме тому ComfyUI зберігає свої workflow-файли у JSON. У ньому описано абсолютно все - від координат нодів на полотні до того, які моделі підключено і що з чим зв’язано.

Цей формат не намагається бути зручним для людини - він створений для машини, і виконує свою роботу бездоганно. Завдяки JSON користувач може миттєво передати або поділитися проєктом: ComfyUI просто зчитує файл і точно відтворює всю структуру.


Friday, 10 October 2025

Cam motion prompts.

Всем привет.

Сергей Нейрограф на своем вебинаре "AI Кино" поделился подборкой промтов для движения камеры в кадре. Вебинар был длинным, и "воды" хватало, уж такая там публика собралась, потому переводите вашу скорость на 1.25 и будет вам счастье.

А cam motion промпты (50) здесь:

1. Chase: A camera movement that follows a subject closely, often creating a sense of urgency or pursuit.

Погоня. Движение камеры, которое внимательно следует за объектом, часто создает ощущение срочности или преследования.


2. Looking up: The camera angle is pointed upward, typically to emphasize height or dominance.

Смотрящий вверх. Угол камеры направлен вверх, обычно для подчеркивания высоты или доминирования.


3. Looking down: The camera angle is directed downward, often used to show vulnerability or to highlight a subject from above.

Смотрящий вниз. Угол камеры направлен вниз, часто используется для демонстрации уязвимости или выделения объекта сверху.


4. Action sequence: Filming technique focused on capturing fast-paced, dynamic movements and events.

Экшн-сцена. Техника съемки, сосредоточенная на захвате быстрого, динамичного движения и событий.


5. Slow-motion: Capturing action at a higher frame rate to create a slowed-down effect.

Замедленная съемка. Захват действия с высокой частотой кадров для создания эффекта замедления.

Wednesday, 1 October 2025

Welcome to Pixel AI Studio!

Всім привіт.

Під краплі осіннього дощу вирішив вас порадувати онлайн генератором GenAI власного виробництва. Майже власного, весь код написала за мене Google AI Studio, я лиш давав їй команди що та як я хочу. Дякую каналу ATDIGIT за ідею.

Welcome до Pixel AI Studio

Користування Pixel AI Studio повністю БЕЗКОШТОВНЕ, але мусите мати облікову в Google.

Ви тільки обмежені планом Free Tier де Google рахує кількість звернень, тобто генерацій, за хвилину. Як рахує - мені невідомо, алгоритми міняються часто. Єдине що гарантовано, що раптом платним він не стане.

Тому прошу, користуйтеся та реалізуйте свою творчу уяву на повну. Перелік всіх функцій наведено нижче. Підтримка T2I, I2I, I2V, retouch, masking, styling, animation, upscaling тощо на моделях Gemini 2.5 Flash (aka Nano Banana), Imagen та Veo.

Якщо чогось, фічі або функції, не вистачає то попросіть Code Assistant то додати (перед цим треба вийти з full screen). Це не складно, єдине що вам тоді краще зробити копію моєї Pixel AI Studio. Асистент розуміє як англійську так і Українську мови. Звісно вам самим треба чітко розуміти чого ви бажаєте. В Code Assistant є свої нюанси, але то має бути окрема стаття.


Pixel AI Studio

--- ОСНОВНІ РЕЖИМИ ---

*   Режим одного зображення: Основний робочий простір для поглибленого редагування, ретуші та анімації одного зображення.

*   Режим пакетної обробки: Дозволяє користувачам застосовувати один запит (промпт) ШІ до кількох зображень одночасно. Додаток надає чергу, відстеження статусу в реальному часі для кожного зображення (в очікуванні, в обробці, завершено, помилка) та можливість завантажити всі успішні результати.

Thursday, 11 September 2025

EbSynth online.

Привіт привіт. 

Мій читачу, вам давно відомий EbSynth - це інструмент для творчої обробки відео, який працює за принципом ключових кадрів. Користувач бере відео, вибирає один чи кілька кадрів, редагує їх у будь-якому графічному редакторі (наприклад, додає малювання, змінює кольори чи стилізує під певний художній стиль), а програма автоматично переносить ці зміни на всі інші кадри відео. Для цього застосовуються алгоритми аналізу руху (оптичний потік) та синтезу текстур, завдяки чому правка одного кадру може плавно розповсюдитися на весь ролик. Такий підхід дозволяє створювати ефекти “намальованого вручну” відео, колоризувати чорно-білий матеріал, робити швидку ретуш об’єктів чи додавати художні стилізації.

Спочатку EbSynth існував як безкоштовна офлайн-програма для Windows і macOS, створена студією Secret Weapons. У класичному варіанті робочий процес виглядав так: відео спершу треба було вручну розбити на кадри (наприклад, через FFmpeg), потім вибрати з цієї послідовності ключові кадри, відредагувати їх у Photoshop чи Krita, після чого у самому EbSynth вказати шлях до оригінальних кадрів, шлях до відредагованих і шлях для збереження результату. Програма виконувала обробку локально, використовуючи ресурси комп’ютера, і видавала результат у вигляді нової послідовності кадрів. Для отримання фінального відео ці кадри потрібно було знову зібрати у ролик окремою командою через FFmpeg або у відеоредакторі. Якщо з’являлися артефакти, доводилося додавати нові ключові кадри й повторювати процес.


Я сам їм пару раз користувався коли допилював відео з під Automatic1111-a.

Але ось з’явилася оновлена онлайн-версія EbSynth, доступна через сайт ebsynth.com. Вона працює як хмарний сервіс: користувач одразу завантажує цілий відеофайл, а не послідовність кадрів, і не потребує потужного ПК, оскільки обробка виконується на серверних GPU. Сайт сам пропонує кілька ключових кадрів для редагування, які можна підтвердити або замінити. Відредаговані кадри завантажуються назад, і система автоматично запускає обробку. Результат можна завантажити у вигляді MP4-відео чи PNG-послідовності (залежно від тарифного плану). Якщо в певних місцях результат вийшов з артефактами, у веб-інтерфейсі легко додати ще один ключовий кадр і перерахувати відео.

Таким чином, офлайн-версія дає більше контролю, але вимагає ручних операцій з кадрами й налаштувань, тоді як онлайн-версія максимально автоматизує процес і робить його простим для користувача, проте працює за моделлю підписки з певними обмеженнями у безкоштовному варіанті. Обидві версії реалізують одну й ту саму ідею - редагування ключових кадрів з автоматичним перенесенням змін на весь відеоролик.

Наприклад, якщо потрібно взяти 20-секундний ролик і зробити його схожим на акварельний малюнок, то в офлайн-версії доведеться вручну розбити відео на сотні PNG-кадрів, відкрити потрібний кадр у графічному редакторі, додати стилізацію, а потім через EbSynth і FFmpeg зібрати результат назад у відео. Онлайн-версія спрощує цей процес: достатньо завантажити відео прямо на сайт, система сама вибере ключові кадри, користувач редагує один із них, завантажує назад і отримує готовий оброблений ролик у форматі MP4 без зайвих технічних дій.

В онлайн версії є free план з деякими технічними обмеженнями. Не без цього), інакше навіщо той онлайн.

Щасти вам.


Friday, 1 August 2025

Скажи, кто твой AI, и я скажу, кто ты.


Всем привет.

Популярная фраза теперь звучит так "Скажи, кто твой AI, и я скажу, кто ты." Ажиотаж вокруг AI еще тот. И он оправдан. Вы можете любить или ненавидеть  AI, но с каждым днем его все больше в вашей жизни.

Сегодня процитирю вам АІ-советы от Александра Фролова, начальника отдела информационных технологий МГУ им. адм. Г.И. Невельского.

Нейросети - это мощный инструмент для системных администраторов, который помогает экономить время и решать сложные задачи. Однако важно использовать их с умом: проверять ответы, задавать четкие вопросы и не полагаться на них полностью в критически важных ситуациях. Для сисадминов особенно полезны ChatGPT, GitHub Copilot и Claude, так как они помогают автоматизировать рутинные задачи и находить решения быстрее. 

Для сисадминов (DevOps) особенно полезны ChatGPT, GitHub Copilot и Claude, так как они помогают автоматизировать рутинные задачи и находить решения быстрее.

1. У нас нейросети часто используются в работе, особенно для рутинных задач, поиска информации или генерации идей.

Наиболее популярные инструменты:

ChatGPT (OpenAI): для генерации скриптов, анализа ошибок, поиска решений, документации.

GitHub Copilot: для помощи в написании кода и автоматизации задач.

Perplexity.ai: для поиска информации и быстрого получения ответов на технические вопросы.

Bard (Google): для сравнения ответов и поиска альтернативных решений.

Claude (Anthropic): для работы с длинными текстами, например, анализ логов или документации.

Saturday, 26 July 2025

Корректное разрешение картинки в GenAI.

Всем привет.

Сегодня для вас еще одна шпаргалка от гуру GenAI  Дмитрия Невского - про разрешение, какое и для каких моделей лучше использовать при генерации картинок, и почему.

Наверное вы уже слышали, что модели для генерации изображений, например модели Stable Diffusion работают лучше всего с определёнными разрешениями и неправильный выбор может привести к артефактам, искажениям или ошибкам. Давайте разбираться.

STABLE DIFFUSION 1.5 

Одна из самых старших и популярных моделей для генерации изображений. Для этой модели рекомендуются следующие разрешения:

512х512, 512х768, 768х512. Очевидно что требование 512 по одной из сторон!

Почему?

  • Обучалась на изображениях 512х512, из-за чего эти модели больше всех имеют проблемы с глазами и пальцами. 
  • При больших размерах появляются дублирующиеся объекты,  повторяющиеся части тел или растягивающиеся конечности, что в последствии успешно фиксилось расширением Kohya HRFix.
  • Кратность 64 важна для архитектуры UNet.

Итак, здесь все просто, примеры рабочих разрешений:

✅ 512х512 1х1

✅ 512х768 2х3

✅ 768х512 3х2

❌ 256х256

❌ 600х600 (не делится на 64)

❌ 1024х1024 (может давать артефакты)

Как может повлиять?

  •  cлишком маленькое 256х256 потеря деталей.
  •  cлишком большое 1024х1024 задвоение предметов, растяжение конечностей. 

Что бы вы понимали почему так происходит - механизм внимания модели рассчитывается в соответствии с размерами изображения на котором ее обучали, поэтому при большем размере она пытается заполнить пустое пространство создавая копии объекта.

Но даже если размер не делится например на 64 - это не значит, что картинка не будет генерироваться, возможно при использовании некоторых расширений интерфейс скорее всего будет выдавать ошибку.

Saturday, 21 June 2025

Революция восприятия и GenAI.


Всем привет.

От революции восприятия кино до ее заката (или как меня поправляют - трансформации) прошло всего лишь 10 лет. Но прошло еще пару лет и наступила эпоха ИИ где каждый из нас получил совершенно новую возможность - революционировать самостоятельно. Я имею ввиду творческих людей, которым технический прогресс дал возможность выразить себя в кинематографе буквально не выходя из дому.

Причем, что интересно, все новые фишки про которые я мечтал и писал здесь в блоге 15 лет тому теперь можно реализовать на домашнем ПК. 

В крайнем случае на одном из онлайн сервисов, которых сейчас пруд пруди. С текстом можно опробовать свои идеи в ChatGPT, Gemini, Perplexity, Ollama и LM Studio, с изображениями в Dall-E, MidJourney и Krea, с видео и звуком в Suno, ElevenLabs, Runway, Kling, Reffusion и HeyGen. Да что там, свежая Veo 3 выдает чуть ли не эпизоды из вашего будушего фильма без привлечения актеров, оператора, режиссера и сценариста. Теперь вы и только вы едины во всех этих лицах, все что от вас требуется - толково обьяснить словами ИИ что вы от него хотите в итоге.


При наличии соответствующего hardware дома, я про видеокарту NVIDIA, размера VRAM и RAM, можно всецело отдать свое воображение на воплощение идей в ComfyUI, Forge, SwarmUI, LCM, Deforum, SVD, LTXV, Hanyuan, Ruyi, CogVideo, WAN, ControlNet, AnimateDiff, FramePack и прочими инструментами локального GenAI. Было бы желание! Разумеется GenAI дал человеку быструю возможность что-то "родить" в искуcстве, но отсутствие таланта он все равно не заменит.

А сериал "Черное зеркало" помните? Так вот, не перестаю поражаться прозорливости сценаристов. Рекомендую вам лично оценить серии 6.1 и 7.3 с проекцией на сегодняшний день - вчерашние фантазии которые сегодня вполне реальны. Мы живем поистине в очень интересное для человека время.

Мечтайте, творите, и не дайте себя одурачить бредовыми идеями СВО!

Удачи.

Tuesday, 17 June 2025

Dynamic Prompts и шаблоны Jinja2.

Всем привет.

Вы заметили что в расширении «Dynamic Prompts» есть интересное подменю «Jinja2 templates»?

Jinja2 - это движок шаблонов, который позволяет использовать синтаксис в стиле Python в шаблонах. Эта возможность особенно полезна для подсказок Stable Diffusion, поскольку она позволяет создавать один запрос, который генерирует несколько запросов, генерировать рандомизированные элементы внутри запросов, итерировать по элементам, использовать подстановочные знаки и многое другое. Jinja2 может эмулировать результаты, для получения которых обычно требуются сложные скрипты Python.

Чтобы включить шаблоны Jinja2:

1. Установите Dynamic Prompts через браузер расширений.

2. Перезапустите Web UI.

3. Прокрутите вниз до скриптов и разверните аккордеон dynamic prompt.

4. Разверните аккордеон Jinja2 и включите его.


Jinja2 предлагает различные структуры управления, включая циклы и условные операторы, а также фильтры, тесты и макросы, которые позволяют создавать мощные и гибкие шаблоны. Хотя эти функции на первый взгляд могут показаться сложными, их возможности впечатляют.

Операторы Jinja2 начинаются с {% и заканчиваются %} , выражения заключены в {{ }} , а комментарии содержатся в {# #} .

В Stable Diffusion (Automatic1111 или Forge) подсказки определяются с помощью тегов {% prompt %} и {% endprompt %}. Операторы и выражения внутри этих тегов не обязательно должны быть на отдельных строках, но разделены для лучшей читаемости. Эти программные подсказки могут быть длиннее традиционных подсказок, поскольку сгенерированные результаты, как правило, короче.

Saturday, 24 May 2025

Как получить доступ к Veo 3?

Всем привет.

Уверен что вас уже настигла слава Veo 3 и Flow от Google. Гуру GenAI Neurograph предложил  всем рецепт как можно получить к ним доступ уже сегодня.

Итак, для начала как выглядит солянка от Google cо всеми типами доступов?

Для понимания контекста: Veo 3 — это новая модель генерации видео от Google DeepMind, способная создавать не только реалистичное видео, но и синтезировать звук: звуковые эффекты, фоновый шум, диалоги — всё прямо внутри ролика. Посмотрите примеры в сети - результат выглядит бомбезно.


Основные технические характеристики Veo 3:

  • Максимальное разрешение: 4K (в полной версии), 720p (в предварительной версии).
  • Поддерживаемая частота кадров: 24 FPS.
  • Поддерживаемые соотношения сторон: 16:9 (в предварительной версии доступно только это соотношение).
  • Длительность видео: до 8 секунд (в текущей версии API).


Генерация аудио (новая функция):

Нативная генерация звука интегрирована непосредственно в видео. Поддерживаются следующие типы аудио:

- Диалоги между персонажами с синхронизацией губ.

- Звуковые эффекты окружающей среды.

- Звуки животных и природы.

- Фоновые шумы (городской, природный и др.).

- Эмбиентные звуки для усиления атмосферы клипа.


Использование различных элементов как «ингредиентов» для создания видео.

Расширенные творческие инструменты:

- Camera Controls — управление движением камеры, углами и перспективой

- Scenebuilder — бесшовное редактирование и расширение уже сгенерированных кадров

- Asset Management — инструменты для организации и управления элементами проекта

- Ingredients-to-Video - добавление различных элементов в видео.

Saturday, 17 May 2025

Аудит вільного місця на SSD


Привіт привіт.

Не зважаючи на свій SSD-накопичувач в декілька терабайт рано чи пізно приходить момент коли є потреба провести аудит вашого диску на великі файли. Я вже це робив раніше.

Тоді великі за розміром файли (перших 20-ть) я шукав так:

# By files

Get-ChildItem C:\ -recurse -Exclude "VM,Toolkit,swsetup,tmp" | Sort-Object length, lastwritetime -descending | select-object -first 20 | `

ft length, lastwritetime, fullname -wrap -auto

А папки які займають багато місця так:

# By folders

$directorySizes = Get-ChildItem -Path 'C:\' -Directory -Recurse -Exclude "VM,Toolkit,swsetup,tmp" |

    ForEach-Object {

        $directory = $_.FullName

        $size = (Get-ChildItem -Path $directory -File -Recurse | Measure-Object -Property Length -Sum).Sum

        [PsCustomObject]@{

            DirectoryPath = $directory

            SizeInBytes   = $size

        }

    } |

    Sort-Object -Property SizeInBytes -Descending |

    Select-Object -First 15 |

    Format-Table DirectoryPath, SizeInBytes -AutoSize

А сьогодні маю іншу проблему - багато розробників генераторів GenAI або процесів до них не дуже переймаються назвою SD-моделей, точніше назвою файлу моделі. Іноді це просто як pytorch_model.safetensors

Thursday, 15 May 2025

ComfyUI и его фронтенд.

Всем привет.

ComfyUI сейчас переживает процесс трансформации на коммерческие рейки, поэтому у разработчиков не до всего доходят руки.

Например, при очередном апдейте ComfyUI можно получить такое сообщение:

WARNING WARNING WARNING

Installed frontend version 1.17.11 is lower than the recommended version 1.18.9. 

и т.д. Сам ComfyUI при этом будет работать, но кто знает что можно пропустить завтра.

И даже предложение от самой ComfyUI выполнить стандартный update\update_comfyui.bat не решает эту проблему.

Приходиться каждый раз делать ручками так: python.exe -m pip install -r d:\ComfyUI\requirements.txt

Также вы можете добавить ключ в батник запуска ComfyUI : --front-end-version Comfy-Org/ComfyUI_frontend@latest  

Если вы предпочитаете контролировать процесс с конкретной версией фронтенда то следует указать:

--front-end-version Comfy-Org/ComfyUI_frontend@1.17.11

В общем парни, имеем небольшие издержки прогресса. Удачи.

Wednesday, 7 May 2025

Автоматизация труда в GenAI.

Всем привет.

Определенная автоматизация творческого труда в GenAI возможна! Само собой на этот счет существует масса скриптов или расширений для Forge/Automatic1111 которые позволяет выполнять пакетную генерацию или апскейлинг.

Вот одно из них - замечательное расширение которое предназначено для пакетного распознавания и генерации описаний (их можно использовать как промпт) по картинке с помощью популярной модели Florence-2. В принципе автор расширения просто добавил то чего не хватает в штатном Florence-спейсе самого Forge.

Итак, переходим в Forge и устанавливаем по ссылке расширение Forge Space Batch Florence-2: https://github.com/Haoming02/forge-space-batch-florence-2.git

Разумеется расширение устанавливается на вкладку "SPACE", поэтому переходим на эту вкладку и жмем напротив BATCH - Florence-2: Image Captioning and Object Detection кнопку "LAUNCH".

После чего в соседней вкладке web-браузера запустится новое окно: 


Переходим в нашу папку с исходными изображениями и копируем ее полный путь. Вставляем путь в поле Working Directory (вверху справа) и жмем кнопку Run, после чего начнется автоматическое распознавание картинок, а рядом с картинками станут появляться TXT-файлики с описаниями.

ВНИМАНИЕ: если в рабочей папке картинки разных размеров то процесс может и стопорнуться (ловим ошибку в консоли ValueError: Unable to infer channel dimension format).

По умолчанию будет выбрана задача (Task) - More Detailed Caption как более подробное описание, для будущих промптов без правки советую использовать именно ее, можно еще выбрать Caption и Detailed Caption, но деталей будет меньше. Справа, если убрать галочку - Recursive то кроме промптов будут сохраняться копии файлов с отметками на каких местах на картинках был фокус модели при анализе. Возможно вам это будет интересно. Если отметить радиобатон - Cascased Tasks, то вместо текстовых файлов, промпты будут сохраняться в файлах формата json. Куда их можно после применить - пока ответить не берусь.

Версия на печать

Популярное