Shanraq.org Shanraq.org
Триста восемьдесят шесть человек
Культура

Триста восемьдесят шесть человек

Язык был в безопасности, пока на нём говорило достаточно людей. Правило перестало работать: машины учатся на текстах, и способность говорить на языке зависит от объёма написанного. Исландия с населением 386 тысяч держит 215 активных авторов Википедии, Казахстан — 386.

В июле 2026 года казахская Википедия приняла 13 099 правок. Это лучший месяц за семь лет: в январе 2019-го их было 6 325. Рост вдвое.

Хорошая новость, если не с чем сравнивать.

За те же семь лет узбекский раздел вырос с 3 608 правок в месяц до 31 244 — в восемь с половиной раз. Мы растём вдвое, сосед — вдевятеро.

Но и это ещё не число, ради которого написан текст.

Число

В настройках любого раздела Википедии есть строка «активные участники» — сколько человек сделали хоть одно действие за последние тридцать дней. Данные открытые, отдаются по адресу, который может проверить кто угодно.

На казахском языке за последний месяц писали 386 человек.

Не триста восемьдесят шесть тысяч. Триста восемьдесят шесть. Все, кто сейчас пополняет главную открытую энциклопедию на казахском языке, поместились бы в один лекционный зал.

Для сравнения: в исландском разделе — 215 активных авторов. Исландия — страна с населением 386 506 человек, меньше Актобе.

Весь мир в одной таблице

Мы взяли пятнадцать стран с государственным языком, у которого нет второй родины, — то есть тех, у кого корпус на этом языке некому написать, кроме них самих. Для каждой посчитали две величины: сколько статей в Википедии приходится на тысячу жителей и сколько активных авторов на миллион. Данные — статистика Википедии и население по Всемирному банку, расчёт воспроизводится за полчаса.

Страна Население Статей Авторов Авторов на млн
Израиль 10 002 200 403 338 6 760 676
Эстония 1 372 341 261 396 904 659
Исландия 386 506 61 230 215 556
Финляндия 5 619 911 623 439 2 970 528
Словения 2 127 400 198 754 535 251
Латвия 1 866 124 145 111 412 221
Армения 3 033 500 331 239 659 217
Литва 2 888 278 226 585 564 195
Северная Македония 1 824 359 163 625 291 160
Албания 2 377 128 106 179 345 145
Грузия 3 812 518 198 136 360 94
Азербайджан 10 202 830 216 714 879 86
Казахстан 20 592 571 244 775 386 19
Узбекистан 36 361 859 356 701 542 15
Киргизия 7 221 868 76 524 98 14

Три последние строки — вся Центральная Азия подряд. Это не про нас одних.

И одна деталь, которую стоит перечитать дважды: Эстония написала больше статей, чем Казахстан. 261 396 против 244 775. В Эстонии живёт меньше людей, чем в Алматы.

Что не объясняет

Бедность? Не проходит. У Казахстана 14 155 долларов на душу населения. У Армении — 8 556, на сорок процентов меньше, и 217 авторов на миллион против наших девятнадцати. У Грузии 8 968 долларов и 94 автора. Мы богаче тех, кто пишет больше.

Интернет? Тем более не проходит, и это самая неудобная строка во всём расчёте. Доступ к интернету имеют 93% жителей Казахстана — больше, чем в Эстонии (92%), больше, чем в Израиле (88%), заметно больше, чем в Армении (81%). Мы среди самых подключённых стран таблицы и почти в самом низу по написанному. Дело не в том, что людям нечем выйти в сеть.

Размер страны? Израиль вдвое меньше нас и держит 676 авторов на миллион — в тридцать пять раз больше нашего. Азербайджан вдвое меньше нас по населению и пишет в четыре с половиной раза активнее.

Алфавит? Версия выглядела убедительной: страна меняет письменность, корпус раскалывается надвое, машина видит два разных языка вместо одного. Но она разбивается о соседа. Узбекистан переводит язык на латиницу с 1993 года — тридцать три года, дольше нас, — и именно его правки выросли в восемь с половиной раз. Смена алфавита нам мешает, но объяснить разрыв с Эстонией в тридцать пять раз она не может.

Ни одно напрашивающееся объяснение не выдержало проверки.

Что мы на самом деле измеряем

Государство измеряет язык процентами. И вот что эти проценты говорят.

Из «Концепции развития языковой политики в Республике Казахстан на 2023–2029 годы», утверждённой постановлением правительства:

  • доля документооборота на государственном языке: 93% в 2020 году, 96% в 2021-м, 96,5% в 2022-м;
  • по социологическому исследованию, владеют государственным языком: 90,5% в 2020-м, 91% в 2021-м, 92% в 2022-м;
  • по национальной переписи 2021 года владеют государственным языком 13 768 406 человек — 80%;
  • и там же, строкой ниже: в повседневной жизни им пользуются 8 472 661 человек — 49,3%.

Прочитайте последние две строки ещё раз. Это один документ, одна страница, один и тот же предмет. Владеют — восемьдесят процентов. Пользуются — сорок девять. А социологический опрос в тот же год даёт девяносто два.

Девяносто два, восемьдесят и сорок девять — три официальные цифры об одном и том же. Все три верными быть не могут.

Разница между ними — это разница между тем, что человек отвечает анкете, и тем, что он делает, когда анкеты нет.

Куда делись документы

Теперь соедините 96,5% с тем, что мы посчитали выше.

Если государство девять лет подряд производит почти весь свой документооборот на казахском языке, то за эти годы должна была накопиться гора казахского текста: законы, регламенты, решения, переписка, отчёты, экспертизы. Именно такой текст делает язык рабочим — не песни и не стихи, а скучная проза принятия решений. На ней держится любой современный язык.

Этой горы нет.

Меньше 0,1% сайтов. Двести сорок четыре тысячи статей — меньше, чем у Эстонии. Триста восемьдесят шесть человек, пишущих энциклопедию. Глубина 25,9 — то есть корпус, к которому почти не возвращались.

Одно из двух. Либо документы существуют и лежат там, где их никто не видит, — и тогда для языка их всё равно что нет. Либо 96,5% — это доля документов, выпущенных на казахском, а не написанных на нём: подготовленных на другом языке и переведённых перед подписью.

Второе объясняет всё. Переведённый документ засчитывается в 96,5% и не добавляет языку ничего: он производный, шаблонный и часто переведён механически. Гора отчётности выросла, гора языка — нет.

Где на самом деле рождается корпус

Язык живёт там, где на нём принимают решения.

Посмотрите на верх нашей таблицы. Израиль — 676 авторов на миллион, первое место. Иврит сто лет назад был языком богослужения, на котором никто не разговаривал в быту. Он стал живым не потому, что его статус закрепили в законе, а потому, что на нём стали работать: заседать, судить, лечить, воевать, писать научные статьи. Элита перешла на язык — и корпус появился следом.

Эстония, Исландия, Финляндия — то же самое. Там нет отдельной программы по наполнению Википедии. Там просто нет второго языка, на котором удобнее провести совещание.

У нас он есть, и тридцать пять лет он оставался рабочим языком принятия решений. Не по закону — по привычке.

Это видно без всякой статистики, достаточно включить телевизор. Публичное выступление руководителя устроено одинаково уже тридцать пять лет: несколько фраз на государственном языке в начале — и дальше два, три часа по-русски. Так выступал первый президент. Так выступают сегодня — от главы государства до акимов областей и районов. Ритуал соблюдён; работа идёт на другом языке.

Вот эти несколько фраз в начале и есть те самые 96,5% документооборота и 80% владения. А два-три часа после них — это 49,3%.

Разница между цифрой и жизнью, которую мы разбирали абзацем выше, каждый вечер показывают по телевидению.

Это не вопрос патриотизма и не обвинение. Это механика. Язык, на котором не думают те, кто принимает решения, не производит текста — он производит перевод. А перевод, как мы только что посчитали, в корпус почти не идёт.

Пока верх страны работает на одном языке, а отчитывается на другом, цифры будут выглядеть ровно так, как они выглядят. Девятнадцать авторов на миллион. Третье место с конца.

Почему это перестало быть вопросом гордости

Всю историю язык был в безопасности, если на нём говорит достаточно людей. Язык с тринадцатью миллионами носителей не мог исчезнуть — не хватило бы поколений.

Это правило перестало работать, и произошло это на нашей памяти.

Инструменты следующего десятилетия — перевод, поиск, голосовой ввод, помощники, распознавание речи — не изучают язык. Они его статистически восстанавливают по текстам. Способность машины говорить по-казахски есть функция от количества казахского текста, попавшего в обучение. Не от числа носителей. Не от статуса языка в конституции.

По данным W3Techs на 21 августа 2026 года, доля сайтов с содержимым на казахском языке — менее 0,1%. На эстонском — 0,1%. На русском — 3,4%, на английском — 49,5%.

Эстонский, на котором говорит миллион человек, представлен в вебе шире, чем казахский, на котором говорят тринадцать миллионов.

Отсюда следует вывод, который стоит проговорить без обиняков: машины будут говорить по-эстонски лучше, чем по-казахски. Не из-за чьего-то умысла. Из арифметики.

Ещё одно измерение, и оно хуже

Количество статей — грубая мера: заготовку в три строки и разбор на десять тысяч знаков она считает одинаково. Поэтому у Википедии есть своя мера живости раздела — «глубина»: правки на статью с поправкой на долю служебных страниц. Она показывает не сколько написано, а насколько написанное живёт.

Раздел Правок на статью Глубина
Иврит 108,4 343,5
Азербайджанский 41,7 90,2
Армянский 32,8 87,1
Финский 38,7 60,1
Исландский 32,2 52,6
Узбекский 17,5 45,7
Эстонский 27,6 37,6
Казахский 14,9 25,9
Киргизский 8,5 5,5

Одна казахская статья за всю жизнь правилась в среднем пятнадцать раз, эстонская — двадцать восемь, ивритская — сто восемь. Наш корпус не только меньше. Он тоньше: значительная часть — заготовки, к которым никто не возвращался.

Что будет дальше

Указ о переводе казахского алфавита на латинскую графику подписан в 2017 году. Переход планировали завершить к 2025-му, затем сроки сдвинули на 2023–2031 годы.

Это ровно те годы, когда обучаются модели, которыми будут пользоваться наши дети.

Всё, что написано по-казахски за последние тридцать лет, написано кириллицей. Для машины кириллический и латинский казахский — не один язык с двумя начертаниями, а два разных набора символов, если между ними нет большого параллельного корпуса. А параллельного корпуса нет: его никто не составлял.

То есть небольшой корпус мы сейчас делим надвое — и делаем это в те самые годы, когда его следовало бы удваивать.

Кто эти 386 человек

Никто не знает. Это добровольцы. У них нет ставки, отдела и отчётности. Ни одна государственная программа не ставит им задач и не считает их работу своим результатом.

Между тем на язык тратятся настоящие деньги: квоты на телевидении, обязательный дубляж, вывески, экзамены, аттестация чиновников. Всё это производит соблюдение. Ни один из этих механизмов не производит текста, который кому-то захочется прочитать.

Мы построили аппарат принуждения к языку и не построили ни одного института его производства.

Что с этим делать

Из этого следуют три вещи, и все скучные.

Первое. Начать считать объём, а не проценты владения. Сколько знаков на казахском языке появилось в открытом доступе за год, сколько из них — оригинальный текст, а не перевод и не перепечатка. Это измеряется автоматически и стоит ноль.

Второе. Оцифровать то, что уже написано. За советские и постсоветские годы на казахском изданы десятки тысяч книг, диссертаций, газетных подшивок. Всё это лежит в фондах и для машины не существует. Оцифровка архива — единственный способ получить большой корпус, не написав ни строчки нового.

Третье, и оно почти неприлично дешёвое. Триста восемьдесят шесть человек делают эту работу бесплатно. Удвоить их — задача стоимостью в одну транспортную развязку. Из всех проблем страны эта, возможно, самая дешёвая в решении: её нельзя закрыть указом, но можно закрыть зарплатами примерно тысяче человек.

И четвёртое, которого не будет ни в одной программе.

Ни один из трёх пунктов не сработает сам по себе, потому что корпус языка — это осадок от работы на нём. Он образуется там, где на языке спорят о бюджете, ведут следствие и пишут техническое задание. Не там, где на нём открывают памятник.

Тридцать пять лет мы наращивали проценты — владения, документооборота, дубляжа, аттестации. Все они выросли: 92%, 96,5%, 80%. И вот результат, которого ни один из этих процентов не показывает: девятнадцать пишущих на миллион жителей, меньше статей, чем у Эстонии, и менее 0,1% всемирной сети.

Проценты составляет тот, кого по ним оценивают. Корпус не составляет никто — он просто есть или его нет.

Всю неделю мир обсуждал, что Nvidia готовится поддержать финансирование OpenAI примерно на сто миллиардов долларов. Ни одна модель, обученная на эти деньги, не заговорит по-казахски лучше, чем ей позволит корпус, который сегодня пишут триста восемьдесят шесть добровольцев.

И пока те, кто принимает решения в этой стране, принимают их на другом языке, добровольцев будет триста восемьдесят шесть.

Источники

Если вы нашли ошибку или опечатку в тексте статьи, то сообщите нам об этом

Комментарии (0)

Пока нет комментариев. Будьте первым.