公司动态
数据科学图谱的自动化工具-DA-RAGvis
清理收藏夹。一、动机 问题背景1. 自动化 EDA的价值数据科学家平均 40% 的时间 花在手动 EDA 上加载数据、画图、分组、箱型图、分布图等。自动生成 EDA Notebook 具有提升效率的巨大价值。2. LLM-only 自动 EDA 的痛点纯 LLM 推理 的方法如 LIDA存在三个核心问题准确性低选图错误、列用错、图类型不对私有企业数据结构千奇百怪LLM 很容易失效。代码执行不可靠Pass rate 往往 80%。小模型表现差商业模型GPT-4o等效果不错但成本高企业更倾向的本地小模型在 EDA 质量极差。为了解决这些问题该论文提出了一种 用于生成可执行的EDA代码的RAG框架RAGvis该框架基于知识图谱将EDA操作代码与其语义和所使用的数据列联系起来。二、方法概览本论文提出的 RAGvis两阶段图引导的 RAG EDA 框架分为 离线 与 在线 两个阶段离线 阶段Offline Knowledge Graph (KG) Generation and Semantic Enrichment. 即 EDA知识图谱生成与丰富。在线 阶段Online EDA notebook generation 即 EDA notebook的生成。三、离线阶段Offline包括两个步骤①构建EDA知识图谱 与 ②注入 EDA语义该论文的离线阶段是参考其前序工作 KGLiDS 来进行构建知识图谱的感兴趣可以查看其解读与原文。① 构建EDA知识图谱从 1600 份 Kaggle EDA Notebooks 中抽取信息利用 KGLiDS 生成列向量 embeddings但是此时EDA知识图谱 没有 EDA Semantic不知道是 histogram 还是 bar chart。② 注入 EDA Semantic目的是为了使LLM 能够区分 Notebook 中的分类如图类型、 变量数目、使用的列、是否分组具体步骤包括KG-Guided EDA Semantic Extraction 从收集的Kaggle笔记本中提取EDA特定的语义来丰富KG以及Knowledge Graph Augmentation抽取得到的 EDA 语义要写入EDA 知识图谱形成一个「EDA-aware图谱」一、EDA 通用分类体系划分为Univariate、 Bivariate、Multivariate再细分 9 大类图类型Bar, Pie, Box, Distribution, Scatter, Line…。LLM 最终按这个分类来 解析 Notebook。二、Semantic Extraction 与 KG AugmentationNotebook 中的画图代码EDA cell通常依赖前面出现的数据处理步骤比如重命名列、派生新列等。如果仅靠 EDA cell 本身LLM 很容易识别错误的列名或图语义。论文为解决该问题预先构建了一个包含每行代码的 EDA 知识图谱。对每个 EDA cell从 KG 中查询其>再将抽取得到的 EDA 语义要写入 KG形成一个「EDA-aware图谱」。为每个成功解析的可视化操作创建1、新的 “EDA Operation Node”该节点存储chart_typeanalysis_typecolumnsgrouping建立三类关键关系边Performs EDA : EDA 操作 → 执行的代码语句节点Has Column : EDA 操作 → 被分析的列节点Has Grouping Column : EDA 操作 → Notebook 单元可选四、 Online 阶段基于离线阶段得到的EDA知识图谱做 EDA Retrieval检索 EDA Alignment对齐 EDA Refinement优化 EDA Coding Agent代码生成。用户输入一个新数据集RAGvis 执行上述步骤并给出最终的EDA代码。这里新的数据集视为原KG没见过的数据unseen dataset用下角标u来表示。————————————————https://blog.csdn.net/weixin_42045968/article/details/141363950