P/07 · локальные AI-системы
AI — это
не только чат
В одном прототипе AI слышит голос, помнит контекст и отвечает вслух. В другом — превращает рисунок и текстовое описание в управляемый генеративный видеопоток.
- системы
- LLM · diffusion
- ввод
- голос · текст · рисунок
- моя роль
- разработка · прототипирование
01 / два живых демо
Локальный AI
в действии.
Смотреть со звуком
02 / как это работает
Голос, изображение
и действия.
Здесь AI не вынесен в отдельное окно чата. Он становится частью интерфейса и реагирует на привычные человеку действия: речь, рисунок и изменение параметров.
В голосовом прототипе моя речь преобразуется в текст и передаётся локальной модели. Сформированный ответ возвращается через синтез речи голосом Джарвиса, поэтому взаимодействие воспринимается как разговор, а не переписка с формой.
Canvas Diffusion работает с визуальным вводом. Пользователь рисует на холсте, выбирает цвет и задаёт описание результата, а система непрерывно интерпретирует этот ввод как новый кадр. Отдельные параметры позволяют менять привязку к исходному рисунку, влияние текста и степень вариативности.
В более широком контуре голосовой ассистент также работает с долговременной памятью, распознаванием пользователя и компьютерным зрением. Это превращает одиночный диалог в систему, которая сохраняет контекст и может реагировать на происходящее вокруг.
Параллельно я развиваю AI-координатора: он уточняет постановку, ждёт подтверждения, создаёт задачи, сам запрашивает прогресс, замечает блокеры и собирает отчёты. Здесь модель уже не демонстрирует технологию, а участвует в реальном рабочем процессе.
следующий шаг