Мультимодальная нейросеть для распознавания изображений, видео и пространственного мышления, применимая в задачах для роботов и ИИ-агентов.
ZDTaichu5.0-9B — модель на 9 млрд параметров, объединяющая языковой движок Qwen3.5 и модуль распознавания изображений. Она понимает текст, картинки и видео, умеет читать документы, графики и текст на изображениях, решать визуальные задачи и рассуждать о расположении объектов в пространстве. Разработчики позиционируют её как основу для роботов и агентов, которым нужно понимать окружение и планировать действия.
Python★ 688создан 4 сентября 2026форков 155Apache-2.0