l

langextract

由 google 研发

LangExtract是由Google开发的Python库,利用大型语言模型(LLM)从非结构化文本中提取结构化信息。它通过用户定义的指令和少量示例,将文本内容(如临床笔记或报告)转换为结构化数据。该工具通过文本分块、并行处理和多轮提取优化长文档处理,并能将每个提取结果精确地溯源到原文,支持交互式可视化。它兼容多种LLM模型,无论是云端还是本地,无需微调即可适应各种领域。

  • 精确溯源与字符定位:将每个提取结果精确映射回原文,支持可视化高亮。
  • 结构化输出与Schema强制:基于用户定义Schema和少量示例,确保可靠的结构化数据输出。
  • 长文档优化提取:采用文本分块、并行处理及多轮提取策略,提升长文本召回率。
  • 交互式结果可视化:自动生成HTML文件,直观展示和审查提取实体。
  • 多LLM模型兼容:支持Google Gemini、OpenAI等云端模型,以及Ollama本地部署模型。
webdesktop