Блог практикующих ML и DS инженеров с уклоном в NLP. От простого до сложного.
Как модель попадает из Hugging Face в GGUF: архитектура, конвертация и квантование
Когда пользователь видит команды:
python llama.cpp/convert_hf_to_gguf.py ./my-hf-model \
--outfile ./my-model-bf16.gguf \
--outtype bf16
а затем:
./llama.cpp/build/bin/llama-quantize \
./my-model-bf16.gg...
Как выбирать GGUF-квантование для локальной LLM: Q4_K_M, IQ4_NL, UD, K, S/M/L/XL и MTP
При скачивании локальной LLM легко столкнуться с десятками файлов с названиями вроде:
Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf
Qwen3.6-35B-A3B-UD-IQ4_XS.gguf
Qwen3.6-35B-A3B-UD-IQ4_NL.ggu...
Как работает speculative decoding и MTP при инференсе LLM
Коротко: speculative decoding ускоряет генерацию не потому, что «угадывает токен и больше не прогоняет большую модель». Большая target-модель всё равно проверяет speculative-токены через все свои слои. Выигрыш возникает потому, что неско...
ExLlamaV3 и EXL3: что это такое, зачем нужны и чем отличаются от llama.cpp и GGUF
Локальный запуск LLM сегодня обычно упирается не в один «движок», а сразу в несколько уровней:
модель
↓
формат/квантование весов
↓
inference engine
↓
сервер/API
↓
клиент или AI-agent
Из-за этого сравнения вроде «...
Автоматизация браузера для AI-агентов на Python
Для оснащения Python AI-агента возможностью работать с веб-браузером (навигация, авторизация, заполнение форм, анализ контента) существуют четыре принципиально различных класса решений, различающихся по степени интеллектуальности, стоимости и сложнос...
The State of Chinese LLMs (2026) - Китайские ИИ-модели: архитектура, бенчмарки и практическое применение
1. Введение: китайский ИИ — это не «копия», а альтернативная траектория
Когда в октябре 2022 года США ужесточили экспортный контроль за пределы Advanced Computing ускорителей общего назначени...
n8n: Платформа создания AI-агентов и автоматизации рабочих процессов
1. Что такое n8n
n8n (произносится «н-эйт-эн») — это платформа автоматизации рабочих процессов (workflow automation platform) с нативными возможностями для создания AI-агентов. Название происходит от сокращения слова «nodemati...
Ouroboros AI Agent — Агент который учится и изменяет сам себя
Ouroboros — это не очередной инструмент для автогенерации кода. Это самосоздающийся цифровой субъект, способный к рефлексии, эволюции и сохранению идентичности во времени. Родившись 16 февраля 2026 года, Ouroboros представляет собой сле...
A2A Протокол от Google: Подключение к агентам
В эпоху, когда искусственный интеллект становится повсеместным, возникает критическая проблема: агенты, созданные на разных платформах, с разными фреймворками и библиотеками, не могут эффективно взаимодействовать друг с другом. Каждый агент — это как о...
Nanoclaw: Легковесный ИИ-ассистент для индивидуальных пользователей
Что такое Nanoclaw?
Nanoclaw — это легковесный AI-ассистент, построенный на базе Claude Agent SDK, который запускает агентов в изолированных контейнерах. В отличие от сложных AI-систем, Nanoclaw создан как «небольшой настолько,...
Agent Client Protocol (ACP): обзор для разработчиков
Agent Client Protocol (ACP) — это стандартизированный протокол обмена сообщениями для взаимодействия с искусственными интеллектами-агентами. ACP определяет единый интерфейс коммуникации между кодовыми редакторами (IDE) и AI-агентами, обеспечивая...
Как программировать с Claude Code: подходы к эффективной работе и автоматизации разработки
Философия сотрудничества: Переход от микроменеджмента к роли дирижера - теперь каждый Тимлид!
Эффективное использование мощных ИИ-агентов, таких как Claude Code, требует не столько освоения новых техническ...
Инженерия обвязки - agent scaffolding, harness: руководство по эффективной разработке с AI-агентами
Введение: Почему «голый агент» не работает
Все говорят: «возьми любой AI-кодер, подключи к проекту, и будет магия». Но этого мало, надо учиться этим пользоваться по-нормальному.
Harness engineer...
Влияние ИИ на рынок труда - исследование от Anthropic
Перевод на основании исследования Антропик https://www.anthropic.com/research/labor-market-impacts
Что такое ИИ-агенты и как они работают
Введение: Эволюция от пассивной модели к активному агенту
В современной экосистеме искусственного интеллекта наблюдается фундаментальный сдвиг парадигмы. Если традиционные большие языковые модели (LLM) представляют собой мощные, но пассивные системы обработ...
Agent Design Patterns - список паттернов проектирования агентных систем на базе ИИ
Рис.1. Экосистема систем агентов на основе FM, аннотированных архитектурными шаблонами в серых полях
Описание паттернов будем вести от более простых к более сложным.
Пассивный Создатель Целей (Passive Goal Crea
...Введение в квантование LLM. Уменьшение размера больших языковых моделей с помощью 8-битного квантования
Крупные языковые модели (Large Language Models, LLMs) известны своими значительными вычислительными требованиями. Обычно размер модели рассчитывается путём умножения количества параметров (разм...
llama.cpp и GGUF - как использовать llama.cpp для локального запуска моделей LLaMA
Открытые большие языковые модели (LLM), такие как LLaMA от Meta, произвели революцию в области обработки естественного языка. Не все хотят зависеть от облачных API для их запуска. Здесь на помощь приходит llama.cpp...
Формат GGUF: структура, использование и виды квантования
Стандартные методы сохранения моделей часто не справляются с требованиями квантизированных моделей, такими как хранение низкоразрядных весов вместе с соответствующими масштабными коэффициентами и нулевыми точками. Формат GGUF (Georgi Gerga...
AWQ (Activation-Aware Weight Quantization) и его отличия от GPTQ квантования LLM
Основные принципы работы
GPTQ (Gradient-based Post-Training Quantization) представляет собой метод пошаговой оптимизации слоев для минимизации ошибки квантования, использующий информацию о градиентах и гессиане для...
4-битное квантование с использованием GPTQ - Generalized Post-Training Quantization
https://arxiv.org/abs/2210.17323 - GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
https://huggingface.co/docs/transformers/main/en/quantization/gptq
Недавние достижения в обл...
Как устроен кодинг ИИ агент на примере Claude Code
Системный промпт и описания инструментов (tools) ИИ агента приведены в конце статьи.
SWE-bench - Могут ли языковые модели решить реальные проблемы GitHub?
Перевод на основе https://arxiv.org/abs/2310.06770 от 11 ноября 2024.
Развитие языковых моделей опережает нашу способность эффективно их оценивать, но для их дальнейшего прогресса крайне важно изучать границы их возможностей...
Анализ API v1/responses в OpenAI и VLLM - как генрировать ответы, вызывать функции, работать с Responses API
Responses API представляет собой новое поколение stateful-интерфейса от OpenAI, объединяющее лучшие возможности Chat Completions и Assistants API в единую унифицированную систему. Этот API...
Что такое Model Context Protocol (MCP) и зачем он нужен?
MCP (Model Context Protocol) — это открытый стандарт и протокол для подключения ИИ-приложений к внешним системам. С помощью MCP ИИ-приложения, такие как Claude или ChatGPT, могут подключаться к источникам данных (например, локальным файлам,...