Hermes Agent от Nous Research — это ИИ-ассистент, который умеет работать с веб-страницами, анализировать изображения, генерировать картинки и озвучивать ответы голосом. Разберём четыре ключевые мультимедийные возможности.
Веб-браузер
Встроенный браузерный модуль позволяет агенту открывать сайты, заполнять формы, кликать по кнопкам и извлекать данные через дерево доступности страницы. Все браузерные инструменты принадлежат тулсету browser — включается через hermes tools.
Бэкенды
- Локальный Chromium — через CDP и команду
/browser connect. Используется по умолчанию, если не настроен другой бэкенд - Browserbase — облачные сессии со стелс-режимом и решением CAPTCHA
- Camofox — локальный антидетект-браузер на Firefox
Бэкенд выбирается автоматически или явно через hermes setup → раздел Browser.
Основные инструменты
browser_navigate— переход по URL, инициализация сессии. Возвращает снимок страницы с ref-ID элементовbrowser_snapshot— текстовый снимок дерева доступности (compact или full)browser_click— клик по элементу по ref-ID (например@e5)browser_type— ввод текста в поле по ref-IDbrowser_scroll— прокрутка страницы (up/down)browser_vision— скриншот с ИИ-анализом (для CAPTCHA и визуальных задач). Если модель не поддерживает vision, автоматически используетсяvision_analyzebrowser_console— чтение консоли и выполнение JavaScript в контексте страницыbrowser_get_images— список всех изображений на странице с URL и alt-текстомbrowser_back,browser_press— навигация назад, нажатие клавиш
Файловые снапшоты (—checkpoints)
Флаг --checkpoints при запуске Hermes включает систему файловых снапшотов. Агент может делать «точки восстановления» состояния файловой системы и откатывать изменения командой /rollback [N]. Полезно при экспериментах с кодом — можно безопасно пробовать и откатывать.
Настройка в config.yaml:
checkpoints:
enabled: true
max_snapshots: 50
Vision: анализ изображений
Модуль Vision позволяет агенту «видеть» картинки. Изображения передаются через вставку из буфера обмена, путь к файлу или URL. Поддерживаются PNG, JPEG, GIF и WebP. Агент может описать содержимое, извлечь текст (OCR), проанализировать диаграмму или сравнить несколько изображений.
Как работает маршрутизация изображений (vision routing)
Когда агент получает изображение, Hermes решает, как его обработать:
- Модель поддерживает vision (GPT-4V, Claude, Gemini, Qwen-VL, MiMo-VL и др.) — изображение отправляется напрямую как пиксели в основную модель. Агент видит картинку «своими глазами».
- Модель текстовая (DeepSeek, Llama текстовые, и др.) — изображение автоматически маршрутизируется через вспомогательный инструмент
vision_analyze. Вспомогательная vision-модель описывает картинку текстом, и описание вставляется в контекст разговора.
Hermes автоматически определяет vision-способности модели из метаданных провайдера — настраивать это вручную не нужно.
Настройка auxiliary vision
По умолчанию auxiliary.vision.provider: "auto" — маршрутизация идёт на основную чат-модель (тот же провайдер и модель, что указаны в model.default). Это НЕ OpenRouter и не отдельная модель — это ваша основная модель.
Если нужно принудительно направить vision-задачи на другой бэкенд:
auxiliary:
vision:
provider: openrouter # варианты: auto, openrouter, nous, codex, main
model: google/gemini-2.5-flash # дешёвая и быстрая
Доступные значения provider:
auto— основная модель (по умолчанию)openrouter— OpenRouternous— Nous Portalcodex— Codex OAuthmain— активный custom endpoint- Любой именованный провайдер из реестра
⚠️ Pitfall: provider: auto НЕ означает «попробовать OpenRouter». В старых версиях Hermes auto-роутинг шёл через агрегаторы, но в текущих сборках auto направляет к основной модели. Не гадайте — читайте официальную документацию.
Генерация изображений
Генерация по текстовому описанию через FAL.ai. Доступно 9 моделей:
- FLUX 2 Klein 9B (по умолчанию) — менее 1 сек, чёткий текст, $0.006/МП
- FLUX 2 Pro — фотореалистичность, ~6 сек
- GPT Image 2 — лучший рендеринг текста, ~20 сек
- Ideogram V3 — лучшая типографика, ~5 сек
- Recraft V4 Pro — дизайн и бренд-системы, ~8 сек
Поддерживаются соотношения сторон landscape, square и portrait. Модель выбирается через hermes tools. Подписчики Nous Portal используют генерацию без ключа FAL через Tool Gateway.
TTS и STT: голосовой ввод и вывод
Озвучивание (TTS)
Агент озвучивает текст и доставляет как голосовые сообщения. Провайдеры: OpenAI TTS, xAI (с клонированием голоса), ElevenLabs, Google Cloud TTS, Piper (локально, 44 языка) и пользовательские команды. На Telegram аудио автоматически конвертируется в голосовой пузырь.
Распознавание речи (STT)
Голосовые сообщения из Telegram, Discord, WhatsApp и Slack транскрибируются автоматически. Локальный Whisper (бесплатно, модели от tiny до large-v3), Groq API, OpenAI Whisper и Mistral Voxtral. Автоматический фолбэк между провайдерами.
Заключение
Браузер, vision, генерация изображений и голосовой ввод/вывод превращают Hermes Agent в полноценный мультимедийный инструмент: открыть сайт, проанализировать данные, сгенерировать иллюстрацию и озвучить результат — всё в одном разговоре.