Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Мы запускаем крупнейший открытый набор данных о работе с CAD-системами. Он охватывает Siemens NX, SolidWorks, AutoCAD и другие системы и включает описания заданий, входные файлы, записи экрана, синхронизированные действия мыши и клавиатуры, а также выходные файлы. Более 50 000 часов данных.
https://x.com/DevvMandal/status/2090476514488000584
https://www.markovstudios.com
Роботам будет на чём учиться.
Однако основной bottleneck здесь, вероятно, не только в отсутствии подобных данных. Современные языковые и мультимодальные модели по-прежнему гораздо лучше работают с дискретными символическими представлениями — текстом и кодом, — чем с точным пространственным представлением объектов. Говорить, что они буквально «мыслят языком», было бы упрощением, но архитектурно и обучением они действительно сильно смещены в эту сторону. Даже современные vision-language модели заметно уступают человеку в пространственных задачах: понимании взаимного положения объектов, перспективы, вращений, геометрии и особенно полноценной 3D-сцены.
Отсюда и привлекательность представления моделей через код, дерево построения или другие структурированные описания. Для модели это гораздо более удобное пространство: операции явно названы, зависимости дискретны, результат можно проверять и исправлять по шагам. Когда же существенная часть информации существует только в геометрии или на экране CAD, модель должна сначала восстановить из визуального представления достаточно точную внутреннюю картину сцены, и именно здесь часто возникают ошибки. Поэтому проблема не столько в «токенизации картинки» как таковой, сколько в недостаточно развитом пространственном представлении и рассуждении поверх него.
Если этот разрыв удастся существенно сократить на уровне самих моделей — дать им устойчивое внутреннее представление 2D/3D-геометрии, пространства и действий над ним, — CAD действительно станет одной из областей, где ИИ превзошёл человека в рутинных операциях. Пока же индустрия в значительной степени компенсирует слабость ядра обвязкой: собирает огромные наборы траекторий работы, добавляет структурированные CAD-представления, инструменты, обратную связь, верификацию результатов и агентные циклы. То есть сейчас совершенствуется прежде всего среда вокруг модели; следующий качественный скачок должен произойти уже в способности самой модели понимать пространство.