НЕЙРОСЕТИ · ВИДЕО

Нейросеть для монтажа видео: что работает на обычном ноутбуке

Я собираю рилсы через нейросети год. Половина инструментов из статей и подборок на моём ноутбуке просто не запускается.

Разбираю по частям: что нейросеть в монтаже делает хорошо, где она бесполезна, и какие цифры это дало на моих роликах.

Павел Ростовцев
Павел Ростовцев13 минут чтения · 30 августа 2026

Обещают одно: закинул папку с видео, получил готовый ролик.

На практике монтаж разваливается на пять разных задач, и нейросеть закрывает четыре из них.

Если некогда читать
  • Расшифровка и субтитры: нейросеть делает лучше человека, тайминги до слова
  • Поиск кадра в архиве: работает, если архив заранее проиндексирован
  • Нарезка под музыку: считает бит и режет по нему без вас
  • Выбор, какой кадр красивый: не работает, отбираю глазами
  • Половина громких инструментов требует видеокарту NVIDIA, на встроенной графике они не запускаются вообще

Что нейросеть в монтаже делает хорошо

Подробнее про титры: как сделать субтитры к видео на русском.

Монтаж это не одно действие. Внутри пять разных задач, и они автоматизируются по-разному.

Вывод расшифровки речи с таймкодами на каждую фразу
Расшифровка отдаёт границы каждой фразы. Тайминги на глаз после такого не ставят
  • Расшифровать речь и поставить субтитры. Тут нейросеть точнее человека: она даёт тайминги на каждое слово
  • Найти нужный кадр среди тысяч файлов. Работает, если архив заранее проиндексирован
  • Нарезать под музыку. Считает бит и ставит склейки в доли
  • Убрать паузы и слова-паразиты. Режет по границам слов из расшифровки
  • Выбрать, какой кадр красивый. Вот тут провал, к этому вернусь в конце

Железо: почему половина нейросетей не запустится

Первое, обо что спотыкаются все статьи про монтаж нейросетью: они написаны для машин с видеокартой NVIDIA.

У меня обычный ноутбук со встроенной графикой Intel Iris Xe. Это не "будет медленнее", это "не запустится в принципе", потому что половина инструментов написана под CUDA.

Что не поехало у меня:

  • Real-ESRGAN, апскейл видео
  • Demucs, разделение голоса и музыки
  • CodeFormer, восстановление лиц
  • RIFE, доклейка кадров для замедления
  • Диаризация в WhisperX, разметка "кто говорит"

Что работает на процессоре без всяких видеокарт:

  • faster-whisper и stable-ts, расшифровка и тайминги
  • RapidOCR, чтение текста с кадров
  • MobileCLIP, смысловой поиск по архиву
  • ffmpeg с фильтрами, включая стабилизацию
  • librosa, разбор музыки на биты

Перед тем как ставить очередной громкий инструмент, я смотрю в его требования. Если там нужна CUDA, у меня оно не пойдёт.

Какие нейросети стоят у меня и за что отвечают

Список инструментов, которые реально работают на моей машине. Все бесплатные, все ставятся одной командой.

ЗадачаИнструментЧто делает
Расшифровка речиfaster-whisperтекст с таймкодом на каждое слово, русский понимает хорошо
Точные тайминги под готовый текстstable-tsвыравнивает известный текст по звуку, режим alignment
Поиск по архиву словамиMobileCLIPсмысловые векторы, ищет по описанию, а не по имени файла
Текст на кадрахRapidOCRловит вшитые плашки и чужие подписи, работает на процессоре
Разбор музыкиlibrosaтемп и доли, чтобы резать в бит
Стабилизацияvidstab в ffmpegдвухпроходная, вытягивает съёмку на ходу
Нарезка сценPySceneDetectразбивает длинное видео на куски по склейкам
Кодированиеffmpeg с h264_qsvаппаратное кодирование на встроенной графике Intel

А ставится это всё через обычный pip, кроме ffmpeg. Возни с драйверами и версиями CUDA нет ровно потому, что видеокарта не нужна.

Субтитры: главное, где нейросеть выигрывает

Раньше я ставил тайминги на глаз. Смотрел ролик, записывал, на какой секунде какая фраза, и подставлял в файл субтитров.

Так делать нельзя. Текст уезжает на две-три секунды, и это видно каждому зрителю, даже если он не смотрел ни одного ролика про монтаж и просто листает ленту.

Правильный путь: расшифровка с пословными таймкодами. Даёшь звук, получаешь каждое слово с точностью до десятых.

Если текст уже известен, а звук взят с записи, работает режим выравнивания в stable-ts: подаёшь готовый текст плюс аудио и получаешь точные границы слов. Это точнее, чем гонять полную расшифровку заново.

Дальше есть тонкости, на которых я обжигался:

  • Резать только по границам слов из расшифровки, иначе фраза обрывается на середине
  • Отступ 30-200 миллисекунд на каждом стыке, тайминги плывут
  • Аудиофейды 30 миллисекунд, иначе на склейках слышны щелчки
  • Субтитры накладывать последними в цепочке фильтров

И обязательная вычитка. Расшифровка ослышивается: "внести" превращается в "мнести", "в воронках" в "баронах". На русском это регулярная история, и вычитка занимает минуту.

Как нейросеть ищет кадр в архиве на 15 тысяч файлов

Это моя главная задача, и готового решения под неё нет.

Статус медиабазы в терминале: 15 430 файлов, смысловой поиск готов
Так выглядит статус базы: сколько файлов, что разобрано глазами, что проиндексировано машиной

У меня в архиве 15 430 файлов: 2975 видео и 12 455 фото за несколько лет. Найти в этом "где я бегу по набережной на рассвете" руками невозможно.

Что я сделал. Прогнал через MobileCLIP весь архив и получил смысловые векторы для каждого файла. Теперь поиск выглядит так: пишу запрос словами, получаю список файлов, отсортированный по смыслу.

А работает это даже на запросах, которых нет ни в одном описании. Сегодня искал "мужчина работает за ноутбуком в кафе с видом на море" и получил нужный кадр четвёртым в списке.

Рядом лежат каталоги, которые я веду руками: каждое видео разобрано построчно с оценкой сочности и лучшей секундой, 224 кадра проверены глазами с точными окнами и сдвигом кропа.

Почему руками. Модель находит похожее по смыслу, но она не знает, что на этом кадре мой знакомый без согласия на съёмку, а тут в кадр попал документ. Для такого у меня отдельный стоп-лист на 44 позиции.

Монтаж под музыку: нейросеть режет в бит

Если задача "нарезать красиво под трек", нейросеть закрывает её целиком.

Инструмент считает темп трека, находит доли и ставит склейки ровно в бит. Дальше выбираешь длину: десять секунд под строб, пятнадцать под быструю нарезку, тридцать под спокойную, полторы минуты под большой ролик.

Отдельно полезен яркостный фильтр: он отбрасывает тёмные кадры автоматически. Мне это правило обошлось дорого, когда я вручную поставил в хук почти чёрный кадр и потом смотрел, как ролик умирает на первых секундах.

Говорящая голова за минуту работы

Второй сценарий, который у меня собран в одну команду: запись разговора превращается в вертикальный ролик.

Внутри цепочка: расшифровка с пословными таймкодами, вырезание пауз длиннее полусекунды, зумы по границам слов, автопоиск лица для кадрирования в вертикаль, субтитры чанками по два слова, музыкальная подложка с приглушением под голос.

Двадцать семь секунд готового ролика собираются за тридцать одну секунду работы. Замер снят на своём скрипте с моделью small, на модели покрупнее время растёт.

Что важно на записи, иначе конвейер не спасёт:

  • Лицо крупно по центру, тогда вертикаль кропится без потерь
  • Паузы в секунду-две между мыслями, по ним идёт нарезка
  • Оговорился, повторяешь фразу заново не останавливая запись
  • Вставку называешь голосом, "тут покажу скрин", и она подставится по таймкоду

Запись беру с локального файла, а не из облака. Облачная версия отдаёт 360p, а после растяжки в вертикаль это мыло, такое стыдно публиковать.

Тряска, поворот кадра и другие мелочи, которые ломают всё

Три вещи, на которых я потерял больше всего времени.

Поворот кадра. Телефонные ролики записываются как 1920 на 1080 с пометкой "повернуть на 90". Программы этот поворот применяют сами и отдают уже вертикальный кадр. Я однажды прочитал размер, решил, что клип горизонтальный, и полдня строил трекер, чтобы вырезать из него вертикаль. Кадр был вертикальным с самого начала. Теперь первым делом смотрю поворот.

Тряска. Двухпроходная стабилизация в ffmpeg вытягивает даже съёмку на ходу. Первый проход анализирует, второй выравнивает.

Вшитый текст. Кадры из сторис часто несут поверх себя старые плашки и подписи. Их ловит распознавание текста: если надпись держится на одной высоте несколько кадров подряд, значит она вшита, а не случайно попала в кадр.

Финальная проверка, которую нельзя пропускать

Что бы ни собрала машина, последний шаг всегда один: контактный лист.

Контактный лист из восьми кадров архива для финальной проверки
Финальная проверка: раскладываю кадры сеткой и смотрю глазами. Ловит то, что автомат пропускает

Раскладываю ролик на кадры сеткой и смотрю глазами. Это ловит то, что не поймает ни один автомат: чужого человека в кадре, забытую плашку, субтитр, уехавший на секунду, некрасивый кадр в самом начале.

За два дня активного монтажа такая проверка спасла меня пять раз.

Сколько времени занимает один ролик

Зависит от того, откуда берётся картинка.

Говорящая голова из записи разговора: минута работы на полминуты готового ролика. Тут почти всё делает конвейер, человек только вычитывает расшифровку.

Ролик из архивных кадров под музыку: от получаса. Машина нарежет под бит за секунды, но кадры нужно отсмотреть глазами, а это и есть основное время.

Ролик со сложным монтажом, где важен порядок сцен: несколько часов, и нейросеть тут помогает только на отдельных шагах.

Сколько это дало по факту

Теперь про результат.

Я разобрал 14 своих рилсов по цифрам из статистики:

  • Средние просмотры 114
  • Потолок у всех четырнадцати 100-170, никто не пробил
  • Комментариев ноль у всех
  • Сохранений и пересылок в среднем чуть больше одной, чаще ноль

При этом удержание было хорошим, от 5 до 20 секунд. То есть снято и смонтировано нормально, люди досматривали.

Но разгадка оказалась не в монтаже. Все четырнадцать роликов собрали по 100-170 показов и остановились там. Сохранений и пересылок у них в среднем чуть больше одной, а чаще ноль, комментариев не было вообще.

До этих четырнадцати был один, который пробил: 2695 просмотров и 41 сохранение с пересылками. Все, что вышли после него, упёрлись в потолок.

При этом половина причины оказалась технической. Ролики уходили в публикацию через API без подписи, то есть немыми, и не цеплялись к странице трендового звука. Это два источника показов, которых у них просто не было. Вторая половина в содержании: сохранить или переслать такой ролик было незачем.

Что я не отдаю нейросети

А три вещи оставляю себе.

Выбор кадра. Есть модели, которые оценивают красоту кадра, но обучены они на стоковых картинках и тянут в сторону гладкой картинки из фотобанка. Как грубый фильтр мусора годятся, как последнее слово нет.

Смысл ролика. Тут всё как с текстами: если рассказать нечего, машина ускоряет выпуск пустоты.

Решение о публикации. В архиве есть чужие лица, документы и личное. Ни одна модель не знает, что можно показывать, а что нет.

Частые вопросы

Какая нейросеть монтирует видео целиком?

Целиком не монтирует ни одна. Есть инструменты под отдельные задачи: расшифровка и субтитры, нарезка под бит, вырезание пауз, кадрирование под лицо. Их связывают в цепочку, а решения принимает человек.

Можно ли монтировать бесплатно?

Да. Всё, что я перечислил, кроме отдельных платных расшифровок, ставится бесплатно и работает на своей машине. Платить приходится за время на настройку.

Нужна ли мощная видеокарта?

Для базовых задач нет. Расшифровка, поиск по архиву, нарезка под бит и стабилизация идут на процессоре. Видеокарта нужна для апскейла, восстановления лиц и генерации, вот там без неё никак.

Сколько времени занимает один ролик?

Говорящая голова на полминуты собирается за минуту. Ролик из архивных кадров под музыку занимает от получаса, потому что кадры нужно отсмотреть.

Нейросеть заменит монтажёра?

На простых форматах уже заменяет. На сложных она делает черновик, который человек правит. Разница как с текстами: производство ускоряется, ответственность за результат остаётся на вас.

Собираете контент через нейросети?

В канале показываю на своих задачах: как ведётся сайт, как пишутся тексты и как собираются ролики, с командами и цифрами.

Разбираю там же промахи, чтобы вы не повторяли мои.

Читать канал

И загляните в справочник признаков машинного текста.

Павел Ростовцев
Павел Ростовцев

Маркетолог и продюсер экспертов.

Веду сайт, тексты и видео через агента, пишу разборы со своими цифрами.

Знаете, кто мучается с монтажом? Переслать в Telegram
Канал
О чём я пишу каждый день
  • Что поручаю агенту и где он ошибается
  • Какие правки на сайте что дали в цифрах
  • Разборы своих постов и чужих воронок

Пишу по ходу работы, а не по итогам года.

Читать канал
Читать канал Читать канал
Made on
Tilda