Наблюдение за исследованиями · 5 августа 2026
ProtoAct добавляет проверяемый слой действий между протоколом и роботом
Новый препринт показывает, почему физическим агентам нужен проверяемый слой структурированных действий перед исполнением.

Робот не должен исполнять лабораторный протокол, опираясь на свободную интерпретацию документа языковой моделью. В этом состоит архитектурная идея ProtoAct — препринта, отправленного в arXiv 3 августа. Авторы описывают фреймворк, который преобразует неформальные биологические протоколы в промежуточное представление с учётом состояния, а затем — в ограниченные JSON-последовательности функций-действий для работы с физической системой.
Изменение состоит не в появлении универсального лабораторного робота и не в заявлении, что модель теперь способна самостоятельно провести полный эксперимент. ProtoAct предлагает более чёткую границу между интерпретацией и исполнением: процессный слой, где условия, подзадачи, параметры, границы действий и зависимости явно представлены, проверяются и доступны человеку для правки до запуска робота.
Именно эта граница делает работу существенной. Для автономных организаций главный вопрос редко сводится к тому, может ли модель написать правдоподобный план. Важнее, можно ли увидеть требования плана, определить пропуски, ограничить допустимое следующее действие и сохранить операционную запись в момент, когда план достигает физической системы. ProtoAct — небольшая исследовательская реализация этого паттерна применительно к wet lab.
Что добавляет ProtoAct
В ProtoAct названы три компонента. ProtoRAG извлекает размеченные примеры протоколов. RefineChecker выявляет пропуски и несогласованности с использованием специфичной для эксперимента информации от пользователя. ActSchema ограничивает выбор действий и заполнение их параметров. Вместе они преобразуют свободный текст протокола в представление, которое можно проверить до превращения в последовательность структурированных вызовов действий.
Порядок здесь важен. Поиск даёт релевантный процедурный контекст; проверка тестирует формирующуюся процедуру на неполноту и внутренние противоречия; схема ограничивает словарь действий и ожидаемые параметры. Это не то же самое, что попросить модель рассудить о процедуре и сразу передать её ответ исполнителю. Фреймворк намеренно создаёт промежуточные артефакты между этими этапами.
Для физического агента вывод на естественном языке — ещё не интерфейс исполнения. Это исходный материал для такого интерфейса.
Эти артефакты делают исполнение обозримым. Проверяющий видит условия мониторинга, детализированные подзадачи, зависимости и параметры, а не восстанавливает их из абзаца сгенерированного текста. Он также может изменить их до исполнения. Практически это создаёт место для вопросов, которые скрывает свободный план: какое условие нужно отслеживать? какое действие здесь допустимо? какой параметр ещё не привязан к основанию? что должно произойти до этого переноса или манипуляции?
Доказательства относятся к компонентам, а не к автономности вообще
Авторы представили BioP2E — набор данных из 22 публичных протоколов клеточных культур. В нём 258 условий мониторинга, 910 исполнимых подзадач и 962 привязанных вызова действий. Два протокола использовались как источники для поиска, остальные 20 — для оценки моделей. В исследовании оценивались семь больших языковых моделей.
Особенно полезны результаты абляционных экспериментов, поскольку они разделяют роль каждого слоя. Удаление ActSchema дало наибольшее заявленное ухудшение F1 для примитивов действий и их параметров. Удаление RefineChecker увеличило число пропусков и ошибок порядка действий. Удаление ProtoRAG сильнее всего повлияло на метрики условий мониторинга. Отсюда следует сдержанный вывод: ограничения, проверка и поиск — не декоративная обвязка модели; в оценке авторов каждый компонент адресует отдельный тип процедурных ошибок.
В статье также оцениваются последующие физические задачи. В пяти симулированных задачах манипуляции заявленная успешность SmolVLA находилась в диапазоне от 66% до 98%, а тестируемой модели π0 — от 34% до 96%. Для физической проверки команда построила три задачи для роботизированной руки как непрерывный рабочий процесс и собрала по 100 телеуправляемых демонстраций на задачу. Обе тестируемые vision-language-action модели выполнили задачи; SmolVLA описана как более стабильная. Численные показатели успешности на физическом роботе в статье не приводятся.
Это существенное различие. ProtoAct создаёт структурированные представления задач и действий, используемые для сбора демонстраций и последующего обучения vision-language-action моделей. Это не сообщение о том, что LLM напрямую управляет низкоуровневым движением робота, и не свидетельство полного автономного лабораторного цикла с обратной связью.
Что не изменилось
ProtoAct остаётся препринтом, а не рецензированным или независимо воспроизведённым исследованием. Его набор данных невелик и ограничен биологическим покрытием 22 протоколов клеточных культур. RefineChecker зависит от специфичной для эксперимента информации пользователя. Роботизированные эксперименты охватывают выбранные задачи манипуляции, а не полные лабораторные операции при меняющихся условиях и результатах. Авторы прямо указывают на эти ограничения.
Схема сама по себе также не делает физическую систему безопасной. Ограниченный словарь действий может не дать агенту выдать действие за пределами этого словаря, но не доказывает достаточность словаря, корректность параметра в контексте или успех физического действия. Операционной среде по-прежнему нужны собственные контроли, точки проверки и записи. ProtoAct помогает точно разместить эту работу в архитектуре, но не отменяет её.
Почему эта архитектура важна и за пределами лаборатории
Та же задача проектирования возникает везде, где агент переходит от рекомендации к последствиям. Процедура закупки, изменение в производстве, финансовая операция или процесс полевого обслуживания могут начинаться с неполного человеческого текста. Нужно преобразовать этот текст в ограниченный процесс, не потеряв условий и зависимостей, от которых зависит его корректность.
Поэтому автономной организации следует считать слой действий объектом первого класса в среде исполнения. Его нужно версионировать вместе с исходной процедурой и извлечённым контекстом. Он должен показывать допустимый набор действий, заполненные параметры, предварительные условия, неразрешённые пробелы и изменения проверяющего. Должна быть возможность восстановить не просто факт действия агента, а проверенное представление, которое разрешило следующее действие.
Репозиторий ProtoAct делает исследовательский паттерн осязаемым: в нём есть приложение для разбора на Streamlit, локальный поиск на основе Chroma, настраиваемые схемы действий, примеры данных и скрипты оценки. Для работы также требуется настроить модель Alibaba Cloud Bailian и сервис эмбеддингов. Это полезный опубликованный код, но не готовая операционная платформа для автономной лаборатории.
Устойчивый вывод относится к архитектуре, а не к конкретной модели. Сильная модель может помочь интерпретировать процедуру. Но она не должна быть единственным местом, где процедура существует между человеческим документом и значимым действием. Между ними нужен проверяемый, ограниченный и редактируемый процессный слой. Именно там организация может добавить проверку, ответственность и операционный контроль до того, как программное обеспечение — или робот — сделает реальную работу.
Источники
- Запись ProtoAct в arXiv, отправлено 3 августа 2026 года: https://arxiv.org/abs/2608.01690
- Статья ProtoAct и описание методики: https://arxiv.org/html/2608.01690v1
- Репозиторий с кодом ProtoAct: https://github.com/gjm112233/ProtoAct

