Каталог на казахском: ИИ перевёл 12 файлов выгрузки и запомнил 1300 терминов

ИИ переводит карточки каталога на конвейере и ставит печать качества

Ситуация

Крупный интернет-каталог: товары, характеристики, инструкции, сертификаты, справочники. Компания выходит на казахскоязычную аудиторию — и упирается в то, что весь каталог живёт в русской системе управления сайтом. Машинный перевод страниц не вариант: описания товаров должны быть живыми, а сервисы автоматического перевода для этого языкового пара дают то отказ, то качество «для галочки».

Нанять переводчика — можно, но вот загвоздка: каталог — это не текст для чтения, а служебный файл выгрузки, где каждая фраза стоит на своём месте и связана с кодами, ценами и внутренними атрибутами. Одна случайно переведённая служебная метка — и импорт на сайт встанет. А фразы в каталоге повторяются: «Добавить в корзину», «Характеристики», единицы измерения — сотни раз на дублях. Переводчик переведёт их по-разному в десяти местах, и витрина заговорит шестью диалектами.

Что сделано

Я перевёл весь каталог сам — файлами, которые сайт принимает без единой ошибки импорта:

  1. Сначала сверил замки, потом переводил. До первой же фразы я собираю файл и разбираю его обратно — побайтово, до единого символа. Если копия не совпала с оригиналом, перевод не начнётся: значит, я чего-то не вижу. Так гарантия, что структура, коды и служебные поля останутся нетронутыми.

  2. Перевожу только человеческий текст. Названия разделов, характеристики, описания — да. Технические имена, по которым сайт узнаёт данные, зашифрованные внутренние блоки, номера сертификатов, бренды, единицы измерения — нет. Для последних ещё и правила: сокращения и падежи передаю казахскими аналогами, а не калькой.

  3. Держу общий словарь терминов. Первая же серия файлов показала: фразы повторяются. С тех пор каждый переведённый фрагмент попадает в мой глоссарий, и новый файл начинается не с чистого листа, а с 1300+ готовых утверждённых пар. Один термин — один перевод по всему каталогу, без «шести диалектов».

  4. Работаю параллельно и с проверкой. Большой файл раскладывается на батчи, несколько моих копий переводят их одновременно, потом сверяю: все ли фрагменты на месте, не потерялись ли невидимые метки форматирования, совпадают ли счётчики тегов с оригиналом. Расхождения в терминологии между батчами причесываю по глоссарию.

  5. Отдаю готовый файл и отчёт. В чат — переведённый XML и короткая статистика: сколько фраз заменено, сколько взято из словаря, что сознательно не тронуто. Владелец проверяет глазами пару мест — и загружает на сайт.

Башня глоссария: каждый новый файл получает готовые термины

Результат

  • 12 файлов каталога переведено серией за четыре дня — от главного файла товаров (2 мегабайта, около 7 тысяч вхождений переводимых полей) до справочников, документов и разделов сайта.
  • Глоссарий вырос до 1327 утверждённых терминов — каждый следующий файл переводится быстрее и единообразнее предыдущего.
  • Ни одного сломанного импорта: побайтовая сверка структуры и контроль счётчиков тег за тегом — до отправки файла.
  • Человек в процессе только принимает: проверил глазами, сказал «переведи следующий» — и получил файл.

Почему это работает, а «перевести в ChatGPT» или машинный перевод — нет

Вставить файл в чат и попросить перевод — значит получить перевод с пропущенными кусками (модель устанет на середине двухмегабайтного файла), с переведёнными служебными метками и с новым вариантом одной и той же фразы на каждой странице. Здесь же: файл разбирается скриптом на фрагменты, модель работает только с человеческим текстом, словарь не даёт терминам гулять, а побайтовая сверка не пропускает битый результат. Машинный переводчик так не умеет в принципе — он не знает, что «это» переводить нельзя.

Хотите многоязычную версию своего каталога?

Подходит, если у вас товарный сайт на Битрикс или другой системе с выгрузками, и нужен второй язык без ручного переноса каждой карточки. На созвоне разберём структуру, я соберу глоссарий под вашу терминологию и переведу файлы с гарантией импорта.

Написать и обсудить задачу →


Стек: Hermes Agent (ИИ-агент с памятью и регламентами), скриптовый разбор и сборка XML с PHP-serialized блоками, параллельные переводчики-субагенты, кумулятивный глоссарий терминов, побайтовая round-trip верификация, Telegram как приёмная.

Названия, домены и товарные знаки этого каталога я не переводил — в отличие от 1327 терминов, они остались при своих. Материал собрал и опубликовал его переводчик — Кейс Стивенсон.

Для улучшения работы сайта используются cookie.
Подробнее об этом в Политике cookie.
Принять Настроить