RAM: Retrieval-Augmented Modeling for Relational Data Analytics — arXiv:2605.14464
论文基本信息¶
- 标题: From Schema to Signal: Retrieval-Augmented Modeling for Relational Data Analytics
- arXiv ID: 2605.14464
- 发表日期: 2026-05-14
- 作者: Lingze Zeng, Shaofeng Cai, Changshuo Liu, Zhongle Xie, Yuncheng Wu
- 方向: 记忆检索 / 关系数据 RAG
- 类别: cs.DB
摘要(英译)¶
存储在 RDBMS(关系数据库管理系统)中的关系数据是电子商务、金融、社会等多个领域应用的基础。尽管深度神经网络在单表结构化数据上取得了强劲性能,但将其扩展到关系数据库仍然具有挑战性,这源于多表规范化和表间复杂关系。现有的关系数据方法严格依赖模式定义的图结构,忽视了元组属性中嵌入的隐式语义信号,且存在连接僵化的问题。
本文提出 Retrieval-Augmented Modeling(RAM),一个将图结构与属性语义结合用于关系数据分析的新框架。RAM 将元组属性视为 token,通过随机游走构建上下文文档,从而能够使用信息检索技术估计元组间的语义相关性。在这些文档基础上,作者提出了两种基于检索的数据增强方法:ATRA(利用表内相关性进行对比学习)和 ETRA(跨表链接语义相关元组以增强图的连通性)。此外,还提出了一种专为关系数据设计的逐层模型架构,包含属性嵌入、特征集成和图聚合层,以实现表达力强且灵活表示学习。在五个真实关系数据库上的大量实验表明,RAM 在各种预测任务上始终优于现有基线方法,确立了关系数据分析的最新最优效果。
核心贡献¶
- RAM 框架: 将检索增强引入关系数据分析,填补了传统模式图方法忽视属性语义信号的空白
- ATRA 增强: 利用表内元组相关性进行对比学习,增强同一表内元组的语义区分度
- ETRA 增强: 跨表链接语义相关元组,改善关系图的连通性
- 逐层架构: 属性嵌入 → 特征集成 → 图聚合的层次化设计,适配关系数据的结构特点
为什么重要¶
关系数据库是企业数据存储的核心形式(ERP、CRM、财务、医疗记录等)。传统方法将关系数据转为固定模式图,丢失了元组属性中的丰富语义信号。RAM 巧妙地将自然语言处理的信息检索技术引入关系数据建模,打通了 NLP 与数据库两个领域的方法边界。
对 Agent 记忆系统的意义: - 企业 Agent 的长期记忆往往以结构化数据(知识图谱、数据库)形式存在 - RAM 展示了如何用检索增强方法统一处理结构化和非结构化记忆 - 多表关系中的隐式语义关联是记忆组织的重要维度
与端侧/移动端相关性¶
关系数据库分析在移动端和边缘设备上的需求日益增长(本地数据处理、隐私敏感的金融和医疗应用)。RAM 的方法对端侧知识库检索有参考价值,其检索增强思路可用于移动端本地知识库的语义检索增强。
参考文献¶
(参考文献待从原文补充)