Shanraq.org Shanraq.org
Как создать свой ИИ с нуля: бесплатный курс для начинающих
Общество

Как создать свой ИИ с нуля: бесплатный курс для начинающих

Бесплатный курс Shanraq: за 30 уроков создайте на Python локальную модель ИИ для казахского текста. Вы научитесь разбирать вопросы, находить проверенные факты, учитывать дату и показывать источник ответа. Если данных недостаточно, модель объяснит причину отказа. Все примеры запускаются на обычном компьютере без платного API.

По запросу «как создать свой ИИ» легко попасть либо в инструкцию по подключению готового чат-бота, либо в сложный курс по нейросетям. Между этими крайностями теряется главный учебный вопрос: из каких решений вообще складывается модель искусственного интеллекта и как проверить каждое из них?

Новый курс Shanraq начинает именно с этого вопроса. Ученик не арендует чужую модель и не прячет работу за одним обращением к чужой программе через API, то есть согласованный способ обмена данными между программами. Он шаг за шагом создаёт небольшую локальную систему для казахского текста: разбирает слова, определяет смысл вопроса, находит утверждённый факт, проверяет дату и источник, а затем либо отвечает, либо объясняет причину отказа.

Хорошая учебная модель должна показывать не только ответ, но и дорогу, по которой она к нему пришла.

Открыть бесплатный курс «AI без LLM: создаем свою модель ИИ»

Можно ли создать ИИ без нейросети и LLM

Можно. Искусственный интеллект — широкое название систем, которые распознают входные данные, выбирают действие или делают вывод. Нейронная сеть хранит усвоенные закономерности в большом наборе числовых параметров. Большая языковая модель, или LLM, — крупная нейронная сеть для работы с текстом и только один из способов построить систему ИИ.

В курсе используется сочетание понятных правил и небольшого классификатора. Классификатор — часть программы, которая относит вопрос к одному из заранее известных видов. Например, вопрос может быть о времени кружка, о месте занятия или оказаться неизвестным. Система считает признаки слов, но окончательное право на ответ получает лишь после проверки источника.

Такой подход похож на работу внимательного библиотекаря. Он понимает, какую карточку просит посетитель, проверяет дату записи и показывает источник. Если подходящей карточки нет, библиотекарь не сочиняет полку и время работы.

Опорная карта урока об отказе при недостатке данных

LLM устроена иначе: она умеет продолжать свободный текст и работать с огромным кругом тем. Благодаря этому она объясняет, переводит и поддерживает диалог. Но правдоподобная фраза ещё не гарантирует верный факт. В узкой системе область знаний гораздо меньше, зато границу ответа можно записать и проверить.

Что ученик создаст за 30 уроков

Итоговый проект принимает дату и вопрос на казахском языке. Например, пользователь спрашивает, когда проходит шахматный кружок. Программа должна пройти несколько ворот:

  1. привести текст к единому виду;
  2. распознать знакомые формы слова;
  3. определить, спрашивают о времени или месте;
  4. убедиться, что вопрос не объединяет два разных требования;
  5. найти ровно одну карточку с фактом;
  6. проверить срок действия записи;
  7. вернуть ответ вместе с датой и источником.

Если одно из условий не выполнено, программа не маскирует пробел уверенной фразой. Она сообщает: вопрос неоднозначен, факт отсутствует или запись устарела.

Умная система начинается с умения сказать: «Этого я не знаю и могу объяснить почему».

К концу курса у ученика остаётся не презентация, а запускаемый проект с файлами данных, проверками качества, текстовой командой для запуска и воспроизводимым измерением скорости.

Почему пример построен на казахском языке

Казахский язык хорошо показывает, как языковое правило превращается в последовательность программных действий. Он относится к языкам с ярко выраженным агглютинативным, то есть последовательным, присоединением частей слова. К основе добавляются различимые элементы, каждый из которых вносит свой смысл.

Жизненный образ — шампур: основа удерживает главное значение, а суффиксы и окончания присоединяются в определённом порядке. Буквы иногда чередуются, встречаются неоднозначность и аналитические конструкции, поэтому программа всё равно обязана проверять свои предположения. Однако сама последовательность частей хорошо видна и удобна для первого морфологического разбора.

Опорная карта типов языкового устройства

Курс не предлагает «свести язык к формуле». Он показывает более полезную мысль: некоторые закономерности можно описать кодом, а исключения и границы нужно сделать видимыми. Именно поэтому казахский материал превращается в хорошую лабораторию алгоритмического мышления.

Как устроен курс ИИ для начинающих

Тридцать уроков объединены одним проектом, но сложность растёт постепенно.

Этап Что происходит
Уроки 1–5 цель проекта, типы языков, части слова и первый ручной разбор
Уроки 6–10 нормализация текста, выделение слов, основ и окончаний
Уроки 11–15 падежные формы, неоднозначность, сущности, намерение вопроса и отказ
Уроки 16–20 каталог проверенных фактов, источник, шаблон ответа и срок действия
Уроки 21–25 учебные примеры, разделение данных, классификатор и измерение качества
Уроки 26–30 границы модели, сравнение подходов, аудит, бенчмарк и итоговая команда

Новый термин появляется после объяснения его назначения. Сначала используется бытовой образ, затем готовый результат, и только после этого — название, код и самостоятельная задача. Опорные карты помогают восстановить ход решения без повторного чтения всего урока.

Каждые пять уроков завершаются рубежом: ученик должен воспроизвести ключевой путь, проверить себя и вернуться к непонятному шагу. Такая организация опирается на идею опорных сигналов Виктора Шаталова, но не заменяет практику красивой схемой.

Какую производительность показала модель

Финальный урок содержит программу benchmark.py, поэтому цифры можно повторить на своём компьютере. Рабочий процесс здесь означает одну запущенную копию Python, которая обрабатывает запросы по очереди. Логическое ядро — одна доступная операционной системе линия выполнения команд. Один такой процесс в нашей программе одновременно использует не больше одного логического ядра, а несколько процессов могут работать на разных ядрах.

Контрольный запуск выполнялся на ARM-компьютере с восемью логическими ядрами, macOS 26.5.2 и Python 3.14.5. ARM обозначает семейство процессоров, а названия системы и Python фиксируют среду опыта.

Рабочие процессы Общая скорость Ускорение Суммарная память процессов
1 42 953 запроса/с 1,00 раза 25,4 МиБ
2 80 372 запроса/с 1,87 раза 50,8 МиБ
4 146 241 запрос/с 3,41 раза 101,7 МиБ
8 141 357 запросов/с 3,29 раза 204,0 МиБ

В этом опыте лучший результат дали четыре процесса. Восемь уже не повысили скорость и почти удвоили расход памяти относительно четырёх.

Файлы учебной модели занимают 6,7 КиБ. КиБ равен 1024 байтам, а МиБ — 1024 КиБ. Весь запущенный процесс вместе с Python использовал 24,4 МиБ памяти. На 16 опубликованных сценариях система дала 16 ожидаемых результатов, включая десять правильных отказов.

Это не обещание идеального качества на любом тексте. Набор мал и открыт, а неверная запись в справочнике останется неверной. Цифры нужны, чтобы ученик различал измерение и рекламное заявление. Подробная методика и сравнение с большими моделями находятся в итоговом уроке курса.

Где такая модель лучше LLM, а где уступает

Узкая модель удобна, когда задача заранее очерчена: расписание, справочник, производственная инструкция, проверяемая форма или локальная служба без отправки данных во внешний API. Её правила можно прочитать, факты — заменить одной записью, а отказ — протестировать.

Большая языковая модель значительно сильнее там, где пользователь пишет свободно, темы заранее неизвестны и нужен связный новый текст. Она умеет обобщать и объяснять то, чего учебный классификатор делать не может.

Иногда правильным решением становится смешанная система: LLM разбирает свободную формулировку, а детерминированная часть проверяет разрешённые поля, дату и источник. Детерминированной называют программу, которая при одинаковых входных данных и состоянии проходит один и тот же путь и выдаёт тот же результат.

Зрелое инженерное решение начинается не с выбора самой большой модели, а с точного описания задачи и допустимой ошибки.

Что нужно знать до начала

Курс рассчитан на начинающих в искусственном интеллекте, но предполагает базовое владение Python: переменные, условия, циклы, функции, списки, словари и чтение JSON. Если эти темы пока незнакомы, сначала стоит пройти начальную часть бесплатного курса Python.

Дальнейший маршрут можно построить так:

  • курс Python учит превращать данные в проверяемый проект;
  • курс SQL показывает, как хранить факты и получать воспроизводимые ответы;
  • курс Rust помогает понять строгие типы, память и надёжные консольные программы;
  • курс Go ведёт к веб-приложению, в которое позже можно встроить модель.

Для старта не нужна видеокарта и не требуется платный API. Достаточно обычного компьютера, Python и готовности самостоятельно запускать примеры. Курс открыт без регистрации: начните с раздела «Прежде чем начать», пройдите входную самопроверку и соберите первую часть модели своими руками.

Если вы нашли ошибку или опечатку в тексте статьи, то сообщите нам об этом

Комментарии (0)

Пока нет комментариев. Будьте первым.