Браузер, зрение и генерация изображений

Hermes Agent от Nous Research — это ИИ-ассистент, который умеет работать с веб-страницами, анализировать изображения, генерировать картинки и озвучивать ответы голосом. Разберём четыре ключевые мультимедийные возможности.

Веб-браузер

Встроенный браузерный модуль позволяет агенту открывать сайты, заполнять формы, кликать по кнопкам и извлекать данные через дерево доступности страницы. Все браузерные инструменты принадлежат тулсету browser — включается через hermes tools.

Бэкенды

  • Локальный Chromium — через CDP и команду /browser connect. Используется по умолчанию, если не настроен другой бэкенд
  • Browserbase — облачные сессии со стелс-режимом и решением CAPTCHA
  • Camofox — локальный антидетект-браузер на Firefox

Бэкенд выбирается автоматически или явно через hermes setup → раздел Browser.

Основные инструменты

  • browser_navigate — переход по URL, инициализация сессии. Возвращает снимок страницы с ref-ID элементов
  • browser_snapshot — текстовый снимок дерева доступности (compact или full)
  • browser_click — клик по элементу по ref-ID (например @e5)
  • browser_type — ввод текста в поле по ref-ID
  • browser_scroll — прокрутка страницы (up/down)
  • browser_vision — скриншот с ИИ-анализом (для CAPTCHA и визуальных задач). Если модель не поддерживает vision, автоматически используется vision_analyze
  • browser_console — чтение консоли и выполнение JavaScript в контексте страницы
  • browser_get_images — список всех изображений на странице с URL и alt-текстом
  • browser_back, browser_press — навигация назад, нажатие клавиш

Файловые снапшоты (—checkpoints)

Флаг --checkpoints при запуске Hermes включает систему файловых снапшотов. Агент может делать «точки восстановления» состояния файловой системы и откатывать изменения командой /rollback [N]. Полезно при экспериментах с кодом — можно безопасно пробовать и откатывать.

Настройка в config.yaml:

checkpoints:
  enabled: true
  max_snapshots: 50

Vision: анализ изображений

Модуль Vision позволяет агенту «видеть» картинки. Изображения передаются через вставку из буфера обмена, путь к файлу или URL. Поддерживаются PNG, JPEG, GIF и WebP. Агент может описать содержимое, извлечь текст (OCR), проанализировать диаграмму или сравнить несколько изображений.

Как работает маршрутизация изображений (vision routing)

Когда агент получает изображение, Hermes решает, как его обработать:

  1. Модель поддерживает vision (GPT-4V, Claude, Gemini, Qwen-VL, MiMo-VL и др.) — изображение отправляется напрямую как пиксели в основную модель. Агент видит картинку «своими глазами».
  2. Модель текстовая (DeepSeek, Llama текстовые, и др.) — изображение автоматически маршрутизируется через вспомогательный инструмент vision_analyze. Вспомогательная vision-модель описывает картинку текстом, и описание вставляется в контекст разговора.

Hermes автоматически определяет vision-способности модели из метаданных провайдера — настраивать это вручную не нужно.

Настройка auxiliary vision

По умолчанию auxiliary.vision.provider: "auto" — маршрутизация идёт на основную чат-модель (тот же провайдер и модель, что указаны в model.default). Это НЕ OpenRouter и не отдельная модель — это ваша основная модель.

Если нужно принудительно направить vision-задачи на другой бэкенд:

auxiliary:
  vision:
    provider: openrouter    # варианты: auto, openrouter, nous, codex, main
    model: google/gemini-2.5-flash  # дешёвая и быстрая

Доступные значения provider:

  • auto — основная модель (по умолчанию)
  • openrouter — OpenRouter
  • nous — Nous Portal
  • codex — Codex OAuth
  • main — активный custom endpoint
  • Любой именованный провайдер из реестра

⚠️ Pitfall: provider: auto НЕ означает «попробовать OpenRouter». В старых версиях Hermes auto-роутинг шёл через агрегаторы, но в текущих сборках auto направляет к основной модели. Не гадайте — читайте официальную документацию.

Генерация изображений

Генерация по текстовому описанию через FAL.ai. Доступно 9 моделей:

  • FLUX 2 Klein 9B (по умолчанию) — менее 1 сек, чёткий текст, $0.006/МП
  • FLUX 2 Pro — фотореалистичность, ~6 сек
  • GPT Image 2 — лучший рендеринг текста, ~20 сек
  • Ideogram V3 — лучшая типографика, ~5 сек
  • Recraft V4 Pro — дизайн и бренд-системы, ~8 сек

Поддерживаются соотношения сторон landscape, square и portrait. Модель выбирается через hermes tools. Подписчики Nous Portal используют генерацию без ключа FAL через Tool Gateway.

TTS и STT: голосовой ввод и вывод

Озвучивание (TTS)

Агент озвучивает текст и доставляет как голосовые сообщения. Провайдеры: OpenAI TTS, xAI (с клонированием голоса), ElevenLabs, Google Cloud TTS, Piper (локально, 44 языка) и пользовательские команды. На Telegram аудио автоматически конвертируется в голосовой пузырь.

Распознавание речи (STT)

Голосовые сообщения из Telegram, Discord, WhatsApp и Slack транскрибируются автоматически. Локальный Whisper (бесплатно, модели от tiny до large-v3), Groq API, OpenAI Whisper и Mistral Voxtral. Автоматический фолбэк между провайдерами.

Заключение

Браузер, vision, генерация изображений и голосовой ввод/вывод превращают Hermes Agent в полноценный мультимедийный инструмент: открыть сайт, проанализировать данные, сгенерировать иллюстрацию и озвучить результат — всё в одном разговоре.