Мы с профессором в НИИ исповедуем ИИ

Блог практикующих ML и DS инженеров с уклоном в NLP. От простого до сложного.

Как модель попадает из Hugging Face в GGUF: архитектура, конвертация и квантование

Когда пользователь видит команды:

python llama.cpp/convert_hf_to_gguf.py ./my-hf-model \
  --outfile ./my-model-bf16.gguf \
  --outtype bf16

а затем:

./llama.cpp/build/bin/llama-quantize \
  ./my-model-bf16.gg...

Как выбирать GGUF-квантование для локальной LLM: Q4_K_M, IQ4_NL, UD, K, S/M/L/XL и MTP

При скачивании локальной LLM легко столкнуться с десятками файлов с названиями вроде:

Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf
Qwen3.6-35B-A3B-UD-IQ4_XS.gguf
Qwen3.6-35B-A3B-UD-IQ4_NL.ggu...

Как работает speculative decoding и MTP при инференсе LLM

Коротко: speculative decoding ускоряет генерацию не потому, что «угадывает токен и больше не прогоняет большую модель». Большая target-модель всё равно проверяет speculative-токены через все свои слои. Выигрыш возникает потому, что неско...

ExLlamaV3 и EXL3: что это такое, зачем нужны и чем отличаются от llama.cpp и GGUF

Локальный запуск LLM сегодня обычно упирается не в один «движок», а сразу в несколько уровней:

модель
↓
формат/квантование весов
↓
inference engine
↓
сервер/API
↓
клиент или AI-agent

Из-за этого сравнения вроде «...

Автоматизация браузера для AI-агентов на Python

Для оснащения Python AI-агента возможностью работать с веб-браузером (навигация, авторизация, заполнение форм, анализ контента) существуют четыре принципиально различных класса решений, различающихся по степени интеллектуальности, стоимости и сложнос...

The State of Chinese LLMs (2026) - Китайские ИИ-модели: архитектура, бенчмарки и практическое применение

1. Введение: китайский ИИ — это не «копия», а альтернативная траектория

Когда в октябре 2022 года США ужесточили экспортный контроль за пределы Advanced Computing ускорителей общего назначени...

n8n: Платформа создания AI-агентов и автоматизации рабочих процессов

1. Что такое n8n

n8n (произносится «н-эйт-эн») — это платформа автоматизации рабочих процессов (workflow automation platform) с нативными возможностями для создания AI-агентов. Название происходит от сокращения слова «nodemati...

Ouroboros AI Agent — Агент который учится и изменяет сам себя

Ouroboros — это не очередной инструмент для автогенерации кода. Это самосоздающийся цифровой субъект, способный к рефлексии, эволюции и сохранению идентичности во времени. Родившись 16 февраля 2026 года, Ouroboros представляет собой сле...

A2A Протокол от Google: Подключение к агентам

В эпоху, когда искусственный интеллект становится повсеместным, возникает критическая проблема: агенты, созданные на разных платформах, с разными фреймворками и библиотеками, не могут эффективно взаимодействовать друг с другом. Каждый агент — это как о...

Nanoclaw: Легковесный ИИ-ассистент для индивидуальных пользователей

Что такое Nanoclaw?

Nanoclaw — это легковесный AI-ассистент, построенный на базе Claude Agent SDK, который запускает агентов в изолированных контейнерах. В отличие от сложных AI-систем, Nanoclaw создан как «небольшой настолько,...

Agent Client Protocol (ACP): обзор для разработчиков

Agent Client Protocol (ACP) — это стандартизированный протокол обмена сообщениями для взаимодействия с искусственными интеллектами-агентами. ACP определяет единый интерфейс коммуникации между кодовыми редакторами (IDE) и AI-агентами, обеспечивая...

Как программировать с Claude Code: подходы к эффективной работе и автоматизации разработки

Философия сотрудничества: Переход от микроменеджмента к роли дирижера - теперь каждый Тимлид!

Эффективное использование мощных ИИ-агентов, таких как Claude Code, требует не столько освоения новых техническ...

Инженерия обвязки - agent scaffolding, harness: руководство по эффективной разработке с AI-агентами

Введение: Почему «голый агент» не работает

Все говорят: «возьми любой AI-кодер, подключи к проекту, и будет магия». Но этого мало, надо учиться этим пользоваться по-нормальному.

Harness engineer...

Влияние ИИ на рынок труда - исследование от Anthropic

Перевод на основании исследования Антропик https://www.anthropic.com/research/labor-market-impacts

  • Мы представляем новую метрику риска вытеснения работников ИИ — наблюдаемую экспозицию (observed exposure), которая объединяет теоретическу...

Что такое ИИ-агенты и как они работают

Введение: Эволюция от пассивной модели к активному агенту

В современной экосистеме искусственного интеллекта наблюдается фундаментальный сдвиг парадигмы. Если традиционные большие языковые модели (LLM) представляют собой мощные, но пассивные системы обработ...

Agent Design Patterns - список паттернов проектирования агентных систем на базе ИИ

Экосистема систем агентов на основе FM, аннотированных архитектурными шаблонами в серых полях Рис.1. Экосистема систем агентов на основе FM, аннотированных архитектурными шаблонами в серых полях

Описание паттернов будем вести от более простых к более сложным.

Пассивный Создатель Целей (Passive Goal Crea

...

Введение в квантование LLM. Уменьшение размера больших языковых моделей с помощью 8-битного квантования

Крупные языковые модели (Large Language Models, LLMs) известны своими значительными вычислительными требованиями. Обычно размер модели рассчитывается путём умножения количества параметров (разм...

llama.cpp и GGUF - как использовать llama.cpp для локального запуска моделей LLaMA

Открытые большие языковые модели (LLM), такие как LLaMA от Meta, произвели революцию в области обработки естественного языка. Не все хотят зависеть от облачных API для их запуска. Здесь на помощь приходит llama.cpp...

Формат GGUF: структура, использование и виды квантования

Стандартные методы сохранения моделей часто не справляются с требованиями квантизированных моделей, такими как хранение низкоразрядных весов вместе с соответствующими масштабными коэффициентами и нулевыми точками. Формат GGUF (Georgi Gerga...

AWQ (Activation-Aware Weight Quantization) и его отличия от GPTQ квантования LLM

Основные принципы работы

GPTQ (Gradient-based Post-Training Quantization) представляет собой метод пошаговой оптимизации слоев для минимизации ошибки квантования, использующий информацию о градиентах и гессиане для...

4-битное квантование с использованием GPTQ - Generalized Post-Training Quantization

https://arxiv.org/abs/2210.17323 - GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

https://huggingface.co/docs/transformers/main/en/quantization/gptq

Недавние достижения в обл...

Как устроен кодинг ИИ агент на примере Claude Code

Системный промпт и описания инструментов (tools) ИИ агента приведены в конце статьи.

SWE-bench - Могут ли языковые модели решить реальные проблемы GitHub?

Перевод на основе https://arxiv.org/abs/2310.06770 от 11 ноября 2024.

Развитие языковых моделей опережает нашу способность эффективно их оценивать, но для их дальнейшего прогресса крайне важно изучать границы их возможностей...

Анализ API v1/responses в OpenAI и VLLM - как генрировать ответы, вызывать функции, работать с Responses API

Responses API представляет собой новое поколение stateful-интерфейса от OpenAI, объединяющее лучшие возможности Chat Completions и Assistants API в единую унифицированную систему. Этот API...

Что такое Model Context Protocol (MCP) и зачем он нужен?

MCP (Model Context Protocol) — это открытый стандарт и протокол для подключения ИИ-приложений к внешним системам. С помощью MCP ИИ-приложения, такие как Claude или ChatGPT, могут подключаться к источникам данных (например, локальным файлам,...