О проекте
LevPRO AI — Безопасный локальный AI
Для большинства пользователей — Desktop: скачайте приложение, пройдите мастер настройки и работайте с локальным ИИ. Для разработчиков и команд — ядро (CLI, HTTP API, MCP). После установки модели интернет не нужен. Фокус — приватность, контроль и расширяемость.
Ключевые особенности
Desktop GUI
Готовый клиент для Windows с мастером настройки и чатами; Linux/macOS — позже.
Локальный запуск
venv / bare metal — полный контроль над инфраструктурой без облачных LLM.
Многоуровневая память
Optional L0–L3 и RAG (BM25) для ответов по Markdown без vector DB.
MCP-инструменты
Capabilities из mcp.json; в ядре — recovery tools и ApprovalGate.
Интерфейсы
CLI, stdio NDJSON для хостов, OpenAI-compatible HTTP с SSE.
Надёжность
Супервизор llama-server, circuit breaker, healthchecks, структурированные логи.
Документация и тесты
Markdown-docs, pytest/Hypothesis, coverage gate ≥70%, CI на Ubuntu и Windows.
Технологический стек
Локальный async-runtime на Python: только llama-server, без облачных LLM, LangChain и vector DB.
Ядро и runtime
- Python 3.11+ — основной язык и async-архитектура
- asyncio — агенты, сессии, супервизор процессов
- httpx — клиент к llama-server (OpenAI-compatible)
- local-ai-mcp — MCP bridge (stdio + HTTP)
AI и инференс
- llama.cpp — llama-server, GGUF, LoRA, mmproj
- ReAct loop — tool-calling с circuit breaker
- Planner / autotune — launch-параметры под железо
- Ensemble — optional multi-model routing
Память и RAG
- BM25 — поиск по Markdown без vector DB (optional hybrid)
- Embeddings — опционально через llama-server
- L0–L3 — файловая runtime-память (extra
[memory]) - YAML / JSON / Markdown — конфиг и хранилище
Безопасность
- DirectoryGuard — ограничение путей Core (runtime data / skills)
- ApprovalGate — подтверждение MCP-tools с
requires_approval - jsonschema — валидация аргументов tools
- Host mcp.json — какие серверы и tools доступны агенту
DevOps и качество
- pytest + Hypothesis — unit-тесты, coverage ≥70%
- ruff + mypy — линтинг и статическая типизация
- CI — Ubuntu и Windows (Python 3.11/3.12)
- llama-tools — doctor, plan, inspect, benchmark, quantize
Наблюдаемость
- Structured logging — text/JSON в
logs/ - Event tags — LLM, tools, MCP, memory, monitor
- local-ai health — проверка runtime и llama-server
- Monitor extra — optional RAM/VRAM polling
Где и как применять
LevPRO AI — не готовый чат-бот и не набор интеграций «из коробки», а runtime для локальных агентов. Внешние системы подключаются через MCP-серверы хоста.
Что даёт ядро
Локальный ReAct-агент
- Суть
- Цикл рассуждение → tool call → ответ поверх вашей GGUF-модели на llama-server.
- Как использовать
local-ai cli, Desktop через stdio илиserve-httpдля клиентов.- Плюсы
- Данные инференса остаются на вашей машине; нет облачных LLM API.
Расширения через MCP
- Суть
- Файлы, shell, git, HTTP и любые другие tools — из
mcp.json(stdio или HTTP). - Как использовать
- Хост добавляет MCP-серверы; tools появляются как
mcp_{server}_{tool}. - Плюсы
- Ядро не тащит встроенный sandbox/FS/git: вы сами выбираете, что доступно агенту.
RAG по Markdown
- Суть
- Optional extra
[memory]: BM25 (и hybrid) по файловому Markdown-хранилищу, L0–L3. - Как использовать
- Включить
memory.enabled, положить документы в memory data dir. - Плюсы
- Без Pinecone/Weaviate; подходит для внутренней документации в Markdown.
Операции и железо
- Суть
- Супервизор llama-server, planner/autotune, optional monitor и graceful degradation.
- Как использовать
llama-tools doctor/plan,local-ai health, extras[monitor]/[autotune].- Плюсы
- Меньше ручной возни с ctx/gpu_layers; контроль RAM/VRAM под нагрузкой.
Что собирают поверх
Coding- и DevOps-агенты
- Суть
- Ассистент по коду, ревью, runbook — если хост дал нужные MCP-серверы.
- Как использовать
- Подключить filesystem/git/shell (или свои) MCP; настроить промпты агента.
- Плюсы
- Код и секреты не уходят в облачный LLM; интеграции — на вашей стороне.
Ассистент в периметре
- Суть
- Внутренний чат/агент внутри периметра для команд с требованиями к приватности.
- Как использовать
- Развернуть LevPRO AI runtime + модель; при необходимости HTTP API за reverse proxy.
- Плюсы
- Контроль над данными инференса; соответствие политикам периметра — на стороне внедрения.
Альтернатива LangChain
- Суть
- Минималистичный runtime без LangChain/LlamaIndex: понятный ReAct и конфиг.
- Как использовать
- Форкнуть, править агентов/промпты, подключать MCP и extras.
- Плюсы
- Меньше «магии», проще дебажить, MIT.
Multi-model и skills
- Суть
- Ensemble — разные GGUF на разных агентах; skills — захват успешных процедур.
- Как использовать
- Extras
[ensemble]и[skills]в конфиге. - Плюсы
- Маршрутизация по задачам и накопление рабочих приёмов без облака.
Частые вопросы
Ответы на популярные вопросы об LevPRO AI— от требований к железу до безопасности и расширения.
Это локальный runtime на вашем оборудовании: инференс через llama-server, без облачных LLM API и подписок. Не готовый чат-бот, а agent runtime: сессии, ReAct, MCP-tools и опциональные extras.
Нет. После установки модели и зависимостей ассистент работает полностью офлайн. Интернет может понадобиться только для первоначальной загрузки llama-server, GGUF-модели и пакетов Python.
Минимум — Python 3.11+, свежая сборка llama-server и GGUF-модель под вашу задачу. Параметры запуска (контекст, GPU-слои, batch) рассчитываются автоматически из метаданных модели и характеристик системы. Перед стартом можно проверить совместимость командой llama-tools doctor.
Это runtime/фреймворк. Из коробки — CLI, stdio, optional HTTP, ReAct-цикл и native recovery tools. Capabilities (файлы, shell, git…) — через MCP. Память/RAG, ensemble, skills, monitor — опциональные extras.
Нет. При установленном extra [memory] поиск строится на BM25 и индексе Markdown-файлов без Pinecone, Weaviate и других vector DB. Hybrid-режим с локальными embeddings опционален.
В ядре: DirectoryGuard для путей Core, ApprovalGate для MCP-tools с requires_approval, валидация схем. Изоляция shell/FS — ответственность MCP-серверов, которые вы подключаете в mcp.json.
Да. Любые GGUF, совместимые с вашей сборкой llama-server (облачные LLM-провайдеры не поддерживаются). Агенты и промпты — через YAML; capabilities — через MCP. См. точки расширения и MCP.
Да. Desktop-клиент для Windows ставит окружение через мастер настройки и общается с ядром по stdio. Linux и macOS появятся позже. Для своей оболочки используйте local-ai serve-stdio.
Большинству пользователей достаточно скачать desktop для Windows. Для ядра: зависимости, config.yaml и local-ai cli — в документации; исходный код — на GitLab. Проблемы — через форму отчёта.
Разработчикам, которым нужен локальный LevPRO AI runtime без LangChain; командам с требованиями к приватности инференса; тем, кто собирает ассистентов в периметре и подключает свои tools через MCP.
Задать вопрос
Не нашли ответ выше? Напишите нам — ответим на e-mail в ближайшее время.