-
Публикации
3 -
Зарегистрирован
-
Посещение
Репутация
-3 СлабаяО NeuroLoc
-
Звание
Новичок
- День рождения 04.11.1989
Информация
-
Пол
Мужской
-
Откуда
Я хз
Посетители профиля
125 просмотров профиля
-
Хотелось бы рассказать, как именно я делаю свою нейроозвучку и почему даже небольшая игра может занять сотни часов ручного кропотливого труда. Многие считают, что нейроозвучка делается за несколько нажатий кнопки. На практике это не так. Ниже я описываю свой собственный рабочий процесс. Я не утверждаю, что все авторы работают именно так — это лишь тот подход, которого придерживаюсь я. Всё начинается с распаковки ресурсов игры. Определяется движок игры, находятся инструменты для его вскрытия и распаковки, проходит серия экспериментов для того чтобы оценить, “а смогу ли я потом запаковать всё обратно”. Это самый легкий этап занимающий от одного дня до недели в зависимости от сложности. Допустим, я распаковал, вытащил аудиофайлы. Далее мне нужно просеять 15—20 тысяч аудиофайлов, чтобы найти среди них только те, которые содержат реплики персонажей. Я тут не полагаюсь на автоматизацию, и методом выборочной проверки прохожусь по всем папкам с аудио в ручную отслушивая сотни треков. Это еще +1 день или около того. Теперь, имея аудио с четкой структурой, мне нужно вытащить субтитры и как-то связать отдельную строчку субтитров с каждым отдельным аудиофайлом. Вот тут начинаются сложности, так-как это возможно сделать далеко не всегда. Есть два типа файлов: В которых я легко могу вытащить субтитры; В которых я не могу установить четкую связь “файл-субтитры”. В случаях, когда это сделать невозможно, прогоняю такие аудио через модель, которая распознает текст с высокой долей точности даже для зашумленных звуков. Что я получаю в итоге? Набор строчек где каждый конкретный файл связан с его текстом на английском языке. Далее я должен в ручную прослушать все аудио (тысячи реплик) чтобы понять, соответствует ли то, что там распознано нейронкой тому, что на само деле звучит на записи. Убедившись, что английский текст соответствует, произвожу нейронный перевод на русский язык, и… опять в ручном режиме проверяю, чтобы все было переведено нормально, и соответствовало тому, что говорится на аудио. Сразу же отсеиваются все тексты, которые нейронка перевела “от балды”, т.е. не соответствующие смыслу и стилю оригинала. На этом этапе я уже два раза обработал тексты и аудио! И так, я имею на руках проверенные пары из английский/русский тексты + аудио. Приступаю к генерации! Прогоняю через 2 нейронки все аудио, а то, что получилось, сначала подгоняю под длительность оригинала, а потом вместе с текстами запихиваю в самописное ПО для ручного озвучивания, где я могу в ручную генерировать то, что мне нужно для любой реплики, если мне что-то не нравится. И тут начинается самый сложный этап! Я прослушиваю тысячи реплик в ручном режиме, очень внимательно (и сгенрированные, и оригинал на английском): Если вижу, что аудио по эмоциям прям сильно уступает оригиналу, то я его генерирую заново; Нейросеть не всегда правильно ставит ударения или выбирает нужную форму слова. Например, вместо "замОк" может прозвучать "зАмок". Такие ошибки приходится отлавливать вручную, потому что автоматически определить их практически невозможно, то есть такое аудио я генерирую заново; Если вижу, что интонации совсем неестественные — генерирую заново; Если вижу, что реплика очень ускорена (после подгонки под оригинал), то провожу укладку текста, то есть изменяю реплику так, чтобы она сохранила дух и стиль оригинала, но стала короче настолько, чтобы с приемлемой скоростью поместится в тайминги длительности оригинала, и… — генерирую заново; Если реплика сильно короче получилась чем оригинал, то опять же провожу укладку текста, то есть делаю текст таким, чтобы реплика не была растянута очень неестественно, и персонаж не говорил как пьяный (либо если оставить естественны темп, то реплика прозвучит, а персонаж будет беззвучно хлопать ртом — некрасиво), и далее генерирую заново. Если я обнаруживаю сложное аудио, которое содержит охи/вздохи/крики/смех/свист или любые дополнительные эффекты, то я сначала генерирую нужную реплику, а потом открываю в аудиоредакторе такой файл и с помощью ручного звукомонтажа монтирую аудиодорожку так, чтобы эффекты органично легли на русское аудио. Если что-то не выходит, то все отправляется в помойку и начинаю работу над этим аудио заново. Если попадается аудио, где на одной аудиодорожке разные персонажи, да еще и с эффектами, то приходится вначале отделять прочие звуки от вокала (голоса человека), затем нарезать голос по персонажам прослушивая все внимательно чтобы не там не обрезать случайно, затем генерирую каждую реплику отдельно по правилам изложенным выше, а потом собираю все в одну аудиодорожку в правильном порядке, и в правильные места вставляю все аудио, чтобы каждый голос звучал в свое время, и накладываю снова эффекты (звук мотора, шелест ветра и т.д.). Это самая сложная аудиодорожка в игре, их могут быть сотни, а на работу с одной уходит от десятков минут, до нескольких часов в зависимости от длительности и сложности. Количество генераций одной реплики из примерно в среднем 5-8 тысяч реплик может достигать 10, 20, и даже более! Нередко на то, чтобы получить приемлемое качество одной реплики, уходят десятки минут, и это только одна реплика. На обработку всех файлов уходят месяцы, и это при ежедневной затрате труда в 5-6 часов, почти как на работе. Когда все же наконец предыдущий сложный этап подходит к концу, все аудио снова проходят микро подгонку к оригиналу по длительности, чтобы не было обрывов/щелчков в игре, и интегрируются в игровые архивы. Игра полностью самостоятельно проходится от начала до конца (тут я работаю уже тестером), выцепляются мелкие оставшиеся ошибки, и исправляются, озвучка “шлифуется”. Да, прохожу один раз, не все ветки диалогов вижу, но так я 70-80% оставшихся ошибок зацепляю. Игра после всех манипуляций выкладывается на суд общественности. Это краткая версия моих действий. На деле все еще сложнее. И это я еще не упомянул о том, что для всего этого нужны десятки отлаженных инструментов, которых нет в свободном доступе, и их пришлось создавать с нуля. Повторюсь, я не знаю как там делают другие, да и мне все равно, я делаю именно так и могу отвечать только за свой рабочий процесс. Я не люблю халтуру, поэтому стараюсь как для себя, хотя я ведь и правда делаю для себя те игры, которые хочу пройти сам, и не беру ни с кого никакого доната, ни копейки. Все бесплатно! Самая большая часть времени уходит не на генерацию, а на принятие решений человеком. Проверить перевод, оценить эмоции, подобрать интонацию, адаптировать текст под тайминг, смонтировать сложные реплики, пройти игру целиком и исправить найденные ошибки — все это невозможно автоматизировать одним нажатием кнопки. Именно поэтому работа над одной игрой занимает сотни часов. Моя цель — не заменить профессиональную студию, а создать качественную любительскую озвучку, с которой самому приятно пройти игру. Поэтому при работе приходится искать разумный компромисс между качеством и временем производства. Если бы я шлифовал озвучку ища “ту самую идеальную интонацию”, то это растянулось бы на годы, и озвучка скорее всего не вышла бы никогда. Тут важен компромисс между качеством, и трудозатратами. Надеюсь, вам было интересно заглянуть за кулисы казалось бы такого простого действия, как создание нейроозвучки. Я постарался объяснить простыми словами на самом деле далеко не простой процесс.
-
NeuroLoc изменил свою фотографию
-
Вышла нейросетевая озвучка Terminator: Resistance
NeuroLoc ответил в тему пользователя SerGEAnt в Релизы русификаторов и других переводов
Чё ты мелешь? Какие еще звуки? Конкретику! Где какая реплика какое место в игре точно, а еще лучше видео. У меня на ютубе есть прохождение — точный таймкод и ссылку в студию пожалуйста! Ничего кроме озвучки не трогалось, голоса и интонации оригинальных актеров, что там тебе ИИ уже кажется? Крестится пробовал? Вот так делаешь в ручную каждую реплику, тратишь 2 месяца жизни, чтобы какой-то ноунейм обосрал потом даже не попробовав нормально. Может лучше тоже как другие делать гуано за 5 минут, все равно же обосрут с головы до ног. Ты хоть пробовал играть, или сразу ярлык “херь” просто повесил? Раньше как-то играли и не жаловались, вон в GTA 4 озвучка, вот то “херь”. Можешь конкретно указать на место где тебе”херь” всплыла? И мы сравним с оригиналом. -
Вышла нейросетевая озвучка Hatred
NeuroLoc ответил в тему пользователя SerGEAnt в Релизы русификаторов и других переводов
"Она, конечно, не очень хорошая" Мда... Обидненько! После ручной работы над каждым аудио файлом получить такой вердикт . Озвучка по сравнению с теми нейро-высерами, что сейчас за 3 дня выпускают бездари, просто шикарная. Я сам со своей озвучкой 4 раза прошел игру. П.С.: Есть уже версия 1.3, она значительно лучше апрельской t.me/NeiroZvukInGame/4