Группа DocLang, сформированная компаниями IBM, Nvidia и Red Hat в рамках Linux Foundation, работает над открытым универсальным форматом документов, предназначенным для улучшения процесса подготовки, управления и обмена данными в системах ИИ. Существующие форматы файлов (PDF, JPEG и др.) проектировались для их использования человеком. Задача новой рабочей группы заключается в том, чтобы создать независимый от поставщиков интероперабельный стандарт, который повысит надежность, прозрачность и масштабируемость подготовки документов для ИИ. DocLang определяет структурированный, машиночитаемый формат для документов любого типа (подобно тому, как JSON делает это для данных), встраиваемый в любой инструмент и любой конвейер. Он основан на DocLing, наборе инструментов LF AI & Data, способном преобразовывать созданные с помощью текстового редактора и понятные для человека PDF-файлы или электронные таблицы в структурированные данные. Существующие стандарты документооборота поддерживали сквозное взаимодействие на протяжении десятилетий, но ИИ меняет правила игры. В эпоху ИИ прежде статичные документы проходят множество итераций и отличаются гораздо более высокой динамичностью. Концепция LLM основана на использовании естественных человеческих языков. Предполагается, что компьютер понимает людей независимо от языка или его синтаксиса. Навязывание синтаксиса пользователям — это то, с чем нам приходится сталкиваться сегодня в процессе поисковой оптимизации и написания кода на языках программирования.