LangExtract это официальная
Python-библиотека от Google, предназначенная для извлечения структурированной информации из неструктурированного текста с помощью больших языковых моделей (LLM)
Если говорить проще: она превращает «кашу» из текста (отчеты, медицинские заметки, контракты) в четкие данные (таблицы, JSON) с сохранением ссылок на оригинал.
Каждое извлеченное значение (например, дата в контракте или диагноз в медкарте) сопровождается указанием точного места в исходном тексте (смещения символов). Это позволяет проверить, не «галлюцинирует» ли нейросеть.
Обрабатывает огромные тексты, разбивая их на части (чанки) и выполняя параллельную обработку
Чтобы не упустить мелкие детали, система может проходить по тексту несколько раз, дополняя и объединяя результаты
Хотя она оптимизирована под семейство
Gemini, библиотека также поддерживает работу с OpenAI и локальными моделями через Ollama