Новости

H Company выпустила NeoMME — открытый ИИ-поиск по документам со сжатием индекса в 255 раз

Стартап H Company опубликовал на Hugging Face NeoMME — семейство компактных моделей-кодировщиков для мультиязычного поиска по тексту и изображениям одновременно. Модели на 260 и 800 миллионов параметров нацелены на поиск по сканам и PDF в системах RAG и распространяются с открытыми весами по лицензии Apache 2.0.

Дэми Авалонов основатель NeiroAI 1 мин чтения
H Company выпустила NeoMME — открытый ИИ-поиск по документам со сжатием индекса в 255 раз

Французский стартап H Company, ранее известный агентом-автоматизатором браузера Holo, опубликовал на Hugging Face NeoMME — семейство моделей-кодировщиков для мультиязычного поиска по тексту и изображениям одновременно. В отличие от типичных visual-language моделей, которые склеивают отдельно обученные текстовый и визуальный энкодеры, NeoMME с нуля обучен как единый двунаправленный трансформер, обрабатывающий оба типа данных вместе. Модели вышли в двух размерах — 260 и 800 миллионов параметров — и распространяются с открытыми весами по лицензии Apache 2.0.

Для чего это нужно

Задача NeoMME — поиск по документам для систем retrieval-augmented generation (RAG): вместо того чтобы сначала распознавать текст в PDF и сканах, модель напрямую индексирует изображения страниц и находит нужный фрагмент по смысловому запросу. Модель обучена на 524 млрд токенов, поддерживает контекст 16 384 токена и словарь на 131 тысячу токенов для многоязычных текстов, включая русский.

Что делает семейство заметным

На бенчмарке визуального поиска по документам ViDoRe v3 версия на 260 млн параметров показала лучший результат среди моделей своего класса, а версия на 800 млн сопоставима со специализированными моделями почти вдвое крупнее. Ключевое преимущество здесь не точность, а эффективность:

255×сжатие эмбеддинга одной страницы документа — с 1,5 МБ до 6 КБ, без ощутимой потери качества поиска
51 стр/сскорость индексации при разрешении 2048×2048 — вдвое быстрее сопоставимой по классу ColModernVBERT
800 млнпараметров у старшей модели семейства — против миллиардов у типичных энкодеров для этой задачи

Доступность из России

Ограничений нет: NeoMME распространяется как открытые веса на Hugging Face под лицензией Apache 2.0, разворачивается локально или в собственной инфраструктуре и не требует подписки или региональной привязки — нужны только вычислительные мощности для запуска.

Источник: H Company

Не пропускать важное

Заведите кабинет: добавьте нейросети, которыми пользуетесь, — и получайте только то, что касается именно их. Цены, тарифы, доступность из России, письмо перед списанием. Бесплатно.

Создать кабинет Войти

Читать дальше

Новости вчера OpenAI выпустила ChatGPT Images 2.5: генерация ускорилась вдвое, редактирование стало точнее OpenAI обновила модель генерации изображений в ChatGPT — задержка при создании картинки упала до 50%, а точечные правки перестают затрагивать остальную часть… Новости 8 сентября 2026 OpenAI показала цифры: ИИ-агенты внутри компании уже делают 3,1 «рабочего дня» на каждый день человека OpenAI опубликовала внутреннюю статистику по использованию ИИ-агентов собственными исследователями: за год траты на инференс агентов выросли в разы, а число экспериментов на… Новости 7 сентября 2026 OpenAI выпустила GPT-6 Astra — первую свою модель с «критическим» уровнем киберспособностей 3 сентября OpenAI начала раскатку GPT-6 Astra. Модель стоит в 2,5 раза дороже прежнего флагмана, первыми доступ получили участники закрытой программы по… Новости 5 сентября 2026 Google DeepMind выпустила WeatherNext 3: прогноз погоды точнее и в 5 раз детальнее Новая модель прогноза погоды от Google DeepMind считает прогноз по разрешению в 5 раз детальнее прежней версии и точнее предсказывает осадки. С…

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *