资讯动态

SQL五十年进化论:从关系代数到AI原生的下一站

发布时间:2026/8/5 14:19:23 来源:尧图企业网站定制
五十年前IBM圣何塞研究实验室的一篇论文为数据世界画下了一条长达半个世纪的基线。1974年5月Donald Chamberlin与Raymond Boyce发表了关于SEQUEL的论文这种结构化查询语言后来更名为SQL。从大型机到PC从互联网到云端从批处理到实时分析无数技术在这五十年间升起又落下而SQL始终站在数据交互的中心舞台。Stack Overflow数据显示SQL是专业程序员定期使用的第三大流行语言。IEEE在2023年指出SQL是开发人员在找工作时最需要掌握的技能。这套基于关系代数的语言已经超越了单一技术的范畴成为数据世界的通用语。但此刻SQL正站在一个新的十字路口。AI Agent开始接管代码编写向量数据库打破精确匹配的范式图数据库重新定义关系的表达自然语言处理让人类可以直接向数据库提问。SQL的下一步是什么这个问题从未像今天这样迫近。本文将从SQL的核心竞争力出发分析其正在经历的形态变化并探讨面向AI时代的底层逻辑重构。一、SQL为什么能活五十年1.1 基于数学的稳固根基SQL之所以能穿越技术周期根本原因在于它建立在坚实的数学基础之上。关系模型本身就是简洁而强大的抽象将数据表示为集合将查询表示为对集合的运算。Chamberlin在回顾时指出关系模型既简单又强大、灵活而不失优雅这让种种功能成为可能。当数据被组织为行和列用集合运算来表达查询这套体系在稳定性和可预测性上天然占优。更深层的原因是数据模型、查询语言和优化编译器三者形成了稳固的协同效应。硬件进步让干净、优雅的数据模型成为可能高级的非过程化语言让用户只需描述想要什么而不必关心怎么实现经过优化的编译器则把这套承诺兑现为商业可行的性能。三者相互依存共同支撑了SQL数十年的主导地位。1.2 吸收而非对抗的进化策略SQL成功的第二个关键在于它的进化方式不是对抗新事物而是吸收它们的核心价值。Stonebraker和Pavlo在回顾数据模型四十年演进的论文中已经指出尽管不断有人试图取代SQL或关系模型但关系模型始终是主导的数据模型而SQL则不断被扩展以吸纳其他领域的好想法。这种模式在过去二十年中重复上演。当JSON文档成为Web数据交换的标准格式时PostgreSQL率先引入jsonb类型让关系数据库能够说流利的JSON。当非结构化数据的需求崛起时主流关系平台开始整合向量数据类型和专门的索引结构通过倒排文件索引和HNSW索引为向量数据建立索引同时引入处理向量数据的专门函数。在图形数据方向ISO的SQL委员会已经在扩展SQL标准纳入SQL/PGL以支持属性图查询同时引入了全新的图查询语言ISO-GQL。SQL的适应性同样体现在客户端工具的进化上。新一代ORM-lite工具如Drizzle、Exposed和jOOQ将SQL的严谨性映射到各编程语言的惯用表达中。这些工具让开发者在不牺牲模式完整性的前提下获得了类似NoSQL的代码与数据同语言体验。1.3 Lindy效应的印证Lindy效应说一项技术存活的时间越长它继续存活的时间也越可能长。SQL已经经历了大型机、PC革命、互联网、移动时代现在正进入AI时代。它能够存活至今靠的不是固执而是适应性。它吸收了JSON为Web浏览器重新调整了形态与各种编程语言深度集成。Chamberlin在SQL五十周年的采访中也表达了类似判断我认为SQL并不会消失世界上很大一部分业务数据都是用SQL编码的而且数据具有很强的粘性。关系系统在其功能定位之内表现极佳MySQL、PostgreSQL和SQLite都是质量极高的开源实现。SQL在可见的未来仍将是一种存在性极强的语言。二、SQL正在经历的形态变化2.1 从纯关系向多模态扩展SQL的第一个形态变化是从只服务于关系数据扩展到同时服务关系数据、JSON文档、图数据和向量数据。如前所述主流关系数据库平台正在整合向量数据类型和图形数据类型ISO标准也在推进相应的语言扩展。这意味着SQL的下一步不是被取代而是变得更通用能够满足现代数据和分析应用的需求。开发人员可以在同一个SQL框架内处理多种数据形态而不必为了不同数据类型切换到完全不同的查询语言。2.2 从精确匹配向语义检索延伸传统的SQL查询基于精确匹配WHERE条件判断相等或范围。但AI时代的查询需求正在向语义层面延伸。在向量检索场景中查询方式从精确匹配转为相似性匹配用户关心的是找出最相似的记录而非完全相同的记录。这催生了语义执行的概念数据库开始理解查询的意图而非仅仅执行语法指令。ISO SQL委员会已经在努力将向量查询的语言元素纳入标准这意味着未来的SQL可能原生支持这种语义检索模式而不需要依赖外部扩展。PostgreSQL的pgvector和类似实现提供了这种能力但将其纳入官方标准才能真正形成统一的编程模型。2.3 从人写SQL向AI生成SQL演进SQL使用方式最直观的变化体现在谁在写SQL。过去五十年写SQL的主体始终是人。DBA和开发人员需要精通SQL语法、理解表结构、掌握查询优化技巧。SQL的易用性也正在发生变化。曾有观点指出虽然SQL被设计成面向非程序员的临时用户群体的低门槛技术方案但如今这些用户并不使用SQL他们更倾向于使用Google搜索以及越来越多地使用ChatGPT这样的AI系统。现在Agent自己生成查询语句用户只需要告诉它要做什么。自然语言到SQL的转换正在将交互主体从人切换到AI。根据实测数据当前一代NL2SQL系统处理复杂SQL的准确率已超过85%且原生支持多轮对话。生成式AI在训练过程中接触了大量SQL代码具备为开发人员编写SQL的能力。这并不意味着开发人员不再需要懂SQL而是意味着SQL的使用方式发生了变化。开发者的角色从写SQL的人转变为审SQL的人从手动构造查询转变为验证AI生成的查询是否正确。三、AI时代数据库的底层逻辑重构3.1 操作主体从人切换到Agent酷克数据研发副总裁杨瑜在一个采访中描述了一个深刻的变化以前操纵代码和软件的主体是人路径是明确的。但现在当Agent开始接管代码成为数据的主要消费者和生产者时传统的SQL接口显得笨重且低效。AI无需像人那样去关心底层的表结构设计它需要的是更上层的语义理解和自主交互能力。这个变化带来了三个层面的影响。第一操作主体变了数据库不再需要围绕人能看懂的接口来设计而需要把语义信息直接喂给Agent让AI知道这个表存的是什么、字段代表什么含义。第二数据类型变了数据从纯结构化变成全模态通吃Agent天生就习惯处理非结构化信息把数据拆在十几个不同的系统里跨系统调用的时候不仅慢连基本的数据一致性都保证不了。第三记忆成为数据库的刚需能力Agent的会话状态、交互历史和用户偏好这些动态生成的记忆成为支撑AI不降智的核心。3.2 对数据库架构的现实影响这种变化正在重塑数据库的产品形态。面向AI时代的数据库面临几个具体的技术压力。Agent的调用频率远高于人类用户一次任务可能包含几十次数据库读写且全程不需要人介入。这意味着数据库需要处理更高密度、更碎片化的读写请求。短记忆与长记忆的分层存储正在成为刚需短期记忆追求极致的读写速度长期记忆要求准确的语义检索和关联推理两者不能用同一套存储方案来解决。从架构角度看未来的数据库将不再是单一的关系型、向量型或图数据库而是一个能同时承载事务处理级高频写入、向量语义检索和图多跳关联查询的一体化引擎。AI一次调用就能同时拿到结构化状态、语义相似的历史经验和关联的知识链路这才是支撑Agent跑通全流程的真正底座。3.3 SQL的不可替代性与边界在这个重构过程中SQL并没有被抛弃。即使在NoSQL数据库中大多数产品也支持最常用的SQL命令封装在ISO/ANSI SQL-92标准中。原因很简单SQL如此深入地嵌入在企业IT的数据生态中任何不支持SQL的新数据库都迫使团队在继续使用员工已经熟悉的语言和学习全新查询语言之间做选择。即使SQL最终退居幕后它仍将继续扮演关键角色。大语言模型在训练过程中接触了大量SQL代码能够承担更多为开发人员编写SQL的任务。但这依赖于SQL本身来实际与数据集交互并将结果反馈给用户这使得SQL在未来可能更加重要尽管它对开发人员来说会变得不那么显眼。同时一些向量数据库厂商认为面向AI的应用并不需要SQL。它们主张AI应用应该使用Python优先的API在一次函数调用内完成向量检索、过滤、重排和语义高亮等复杂操作无需查询语言翻译层。这代表着一种更为彻底的路径AI不学SQLSQL也不扩展向量两者各自独立发展。结语SQL的下一步不是一个非此即彼的选择题。它不会消失也不会停留在原地。它会吸收AI带来的新需求就像过去吸收JSON和GIS数据一样。它会适应Agent作为操作主体的新现实在保留语言内核的同时调整与外部世界的交互方式。Stonebraker和Pavlo的论文标题What Goes Around Comes Around... And Around精准地捕捉了数据库技术演进的核心规律。每一次看似颠覆性的新浪潮最终都会在SQL中找到自己的位置而SQL则在吸收这些新思想后继续前行。向量搜索、图查询、自然语言接口都将沿着同一条轨迹融入SQL的生态系统。SQL五十年的历史证明了它的韧性。它能够适应变化不是因为固守传统而是因为有能力在每一次技术变革中重新定义自己。AI时代的到来不是SQL的终点而是它又一次进化的起点。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价