Alibaba представила SkillWeaver: новый метод эффективного управления ИИ-агентами и инструментами

По мере роста корпоративных систем искусственного интеллекта разработчики сталкиваются с проблемой распределения задач между различными инструментами и навыками. ИИ-агенты, имеющие доступ к сотням функций, часто совершают ошибки при выборе нужного инструмента на каждом конкретном этапе работы. Для решения этой проблемы исследователи из Alibaba разработали фреймворк SkillWeaver, который строит граф выполнения задачи и автоматически подбирает наиболее подходящие навыки для каждого узла.

Проблема маршрутизации навыков в сложных задачах

В современных архитектурах ИИ-агентов на базе больших языковых моделей ключевую роль играют так называемые навыки. Навык представляет собой модульную, повторно используемую спецификацию инструмента, описанную на естественном языке.

При интеграции агентов с масштабными экосистемами инструментов точное направление запросов пользователя к нужным навыкам становится сложной задачей. Передача всей библиотеки инструментов в контекст модели неэффективна: это быстро перегружает лимиты контекстного окна и расходует сотни тысяч токенов — минимальных единиц текста, которые обрабатывает нейросеть.

Большинство существующих решений пытаются справиться с этим с помощью поиска через API или иерархических структур, где выбор инструмента происходит за один шаг. Однако такой подход не работает в реальных бизнес-сценариях, где задачи состоят из множества этапов. Запрос вроде «скачай базу данных, преобразуй ее и создай отчет» невозможно выполнить одним инструментом. Требуется разбить задачу на части и последовательно задействовать загрузчик, обработчик данных и генератор графиков.

Как работают SkillWeaver и алгоритм SAD

Разработчики из Alibaba предложили концепцию композитной маршрутизации навыков. Фреймворк SkillWeaver распределяет процесс на три последовательных этапа:

  • Декомпозиция — языковая модель разбивает сложный запрос пользователя на цепочку простых подзадач, для каждой из которых нужен один конкретный навык.
  • Поиск — поисковая модель сопоставляет каждую подзадачу с библиотекой инструментов и формирует список наиболее подходящих кандидатов.
  • Композиция — планировщик оценивает совместимость выбранных инструментов, проверяя, подходят ли выходные данные одного шага в качестве входных данных для следующего. На основе этого строится направленный ациклический граф — схема выполнения, в которой независимые задачи могут запускаться параллельно.

Главная сложность такого процесса заключается в том, что языковые модели часто описывают шаги слишком обобщенно, из-за чего их терминология не совпадает с названиями реальных инструментов в базе. Чтобы исправить это, разработчики внедрили метод итеративной декомпозиции с учетом навыков (Skill-Aware Decomposition или SAD).

Механизм SAD работает по принципу обратной связи: модель составляет предварительный план, система выполняет первичный поиск подходящих инструментов и возвращает их список обратно в модель в качестве подсказок. Получив эти ориентиры, модель переписывает план так, чтобы его шаги точно соответствовали возможностям и названиям реально существующих инструментов.

Результаты тестирования и экономия ресурсов

Для оценки эффективности SkillWeaver исследователи создали тестовый набор CompSkillBench, состоящий из 300 многошаговых запросов различной сложности. В качестве библиотеки использовались более 2200 реальных навыков из открытой экосистемы Model Context Protocol. В тестах задействовали легкую модель Qwen2.5-7B-Instruct с 7 миллиардами параметров для декомпозиции задач и векторный поиск для подбора инструментов.

Эксперименты показали, что декомпозиция является главным узким местом ИИ-систем, но алгоритм SAD значительно улучшает результаты:

  • Точность планирования у модели с 7 миллиардами параметров выросла с 51% до 67,7% при использовании SAD, а у более крупной модели Qwen-Max этот показатель достиг 92%.
  • На сложных задачах, требующих от 4 до 5 различных навыков, применение SAD увеличило точность на 50%.
  • Более крупные модели (например, с 14 миллиардами параметров) без подсказок SAD справлялись хуже, так как излишне дробили задачи на микроскопические шаги. Обратная связь от SAD помогла вернуть планировщик к реальности.
  • Расход токенов сократился на 99,9%. Вместо передачи всей библиотеки инструментов в контекст, что требовало около 884 000 токенов на запрос, SkillWeaver расходует всего около 1160 токенов. Это напрямую снижает затраты на API и ускоряет работу системы.

При этом популярный агентный метод ReAct полностью провалил тесты на декомпозицию, показав нулевую точность, так как его алгоритм сводит сложные планы к изолированным действиям вместо построения целостной цепочки.

Что нужно учитывать разработчикам

Хотя создатели еще не опубликовали исходный код SkillWeaver, систему легко воссоздать самостоятельно. Метод SAD представляет собой оптимизацию промптов и поискового цикла, шаблоны которых описаны в исследовании. Их можно реализовать с помощью популярных библиотек вроде LangChain или LlamaIndex.

Однако при переносе технологии в реальные проекты разработчикам придется учесть несколько нюансов. Во-первых, векторные модели отлично находят десятку подходящих инструментов, но не всегда ставят идеальный вариант на первое место. Для точного ранжирования потребуется внедрить дополнительную модель-реранкер.

Во-вторых, текущая версия SkillWeaver не имеет встроенной системы обработки ошибок. Если на втором шаге выполнения цепочки произойдет сбой, вся последовательность прервется. Для промышленного использования разработчикам необходимо самостоятельно спроектировать механизмы повторных попыток и резервных сценариев поверх этапа композиции.


Понравилась запись? Поделись с друзьями и поддержи сайт: