Vertix

Умный кроп: как бот сам понимает, где текст, где лицо, где курсор

18 августа 2026 г.

«Умный кроп» в интерфейсе Vertix выглядит как один переключатель — «Умный» или «По центру». Но за этим переключателем не один универсальный алгоритм, а несколько разных стратегий кадрирования, и бот сам решает, какую применить, в зависимости от того, что вообще происходит в кадре. Слепое отслеживание лица работает отлично для говорящей головы и плохо для экрана с курсором мыши — поэтому единого рецепта на всё нет.

Сначала — что это вообще за видео

Перед тем как решать, как кадрировать, бот классифицирует исходник по содержанию: это говорящая голова, запись экрана (скринкаст), подкаст с двумя стабильными лицами в кадре, или что-то, что не подошло ни под одну категорию. От результата зависит вся дальнейшая логика — кадрирование настраивается под содержание, а не наоборот.

Говорящая голова — кадр следует за лицом

Самый очевидный случай: в кадре человек, который говорит. Здесь умный кроп честно отрабатывает своё название — вертикальное окно 9:16 отслеживает лицо и держит его в кадре, даже если человек двигается или отходит от исходного положения в горизонтальном видео.

Скринкаст — резать по лицу нельзя, там нет лица

Запись экрана — это отдельный случай, для которого обычное отслеживание лица бессмысленно: там либо нет лица вообще, либо оно занимает угол кадра в веб-камере. Смысл здесь — в том, что происходит на экране: текст, интерфейс, курсор. Резать это в узкую вертикальную полоску 9:16 — значит гарантированно потерять часть текста или элементов интерфейса за краем кадра.

Поэтому для скринкаста бот не сужает кадр до вертикальной полосы, а строит окно шириной около 55% исходного экрана, которое следует за курсором на размытом полноэкранном фоне того же видео. Курсор — это то место, куда на самом деле смотрит зритель на записи экрана, поэтому кадр держится именно за ним, а не за геометрическим центром.

Подкаст на двоих — не кроп, а сплит-скрин

Когда в горизонтальном кадре стабильно находятся ровно два лица — классическая раскладка подкаста, — умный кроп не пытается выбрать, за кем следить, и не мечется между двумя говорящими. Вместо этого он переключается на статичный сплит-скрин: кадр делится на две вертикальные панели, в каждой — своё лицо. Это устойчивее и предсказуемее, чем попытка угадать, кто говорит в конкретный момент, и не создаёт эффекта дёрганой камеры на монтажной склейке.

Если видео не подошло ни под одну категорию

Для содержимого, которое не удалось уверенно классифицировать — ни явная говорящая голова, ни экран, ни подкаст, — есть аккуратный запасной вариант: полный кадр с размытым фоном вместо агрессивного кропа наугад. Это честнее, чем сделать вид, что алгоритм уверен там, где он на самом деле не уверен.

Почему это одна настройка, а не пять

Со стороны пользователя всё это остаётся одним переключателем «Умный кадр» — не нужно заранее знать, что у тебя на видео, и выбирать подходящий режим руками. Классификация происходит автоматически до кадрирования, и именно поэтому добавление нового типа контента в эту логику никогда не требовало нового параметра в интерфейсе — только новое правило внутри одного и того же «умного» режима.