欢迎光临
我们一直在努力

Apache Doris For AI:一站式AI数据底座,重构RAG与智能分析架构(Doris4.X)

随着大模型与AI应用快速落地,传统“数仓+向量数据库+搜索引擎+大模型”的多组件架构暴露出部署复杂、数据冗余、链路延迟高、运维成本大等痛点。Apache Doris 4.0+全新推出Doris For AI能力,打破传统OLAP边界,融合结构化分析、全文检索、向量检索、库内AI推理四大核心能力,构建一站式AI数据基础设施。

一、前言:AI时代数据架构的痛点

当前企业搭建AI应用(尤其是RAG检索增强生成、智能问答、内容治理、AI特征工程)的主流架构,普遍采用分体式架构:

业务数仓(Doris/ClickHouse)存储结构化业务数据 + 向量数据库(Milvus/Pinecone)存储Embedding向量 + 搜索引擎(Elasticsearch)实现全文关键词检索 + 独立大模型服务提供推理能力。

这种多组件堆砌的架构存在诸多致命问题:

  • 数据冗余严重:同一份业务数据需要同步至数仓、向量库、搜索引擎三份存储,存储成本翻倍,数据一致性难以保障;

  • 链路复杂延迟高:AI查询需要跨多组件联动调用,链路层级多,实时性差,无法支撑低延迟AI交互场景;

  • 开发成本高:开发者需要掌握多套组件语法、适配多套SDK,数据同步、任务调度、异常排查成本极高;

  • 运维压力大:多集群部署、版本兼容、资源隔离、故障排查难度陡增,中小团队难以落地维护。

  • 在此背景下,Apache Doris 4.0及4.1版本重磅迭代Doris For AI能力,提出HSAP(混合搜索与分析处理)全新架构,实现一个引擎搞定结构化分析、全文检索、向量检索、库内AI推理,彻底终结多组件碎片化架构,成为AI时代轻量化、高性能的统一数据底座。

    二、Doris For AI 核心架构解析

    Doris For AI 基于原生OLAP架构升级,不依赖任何外部插件,在统一存储、统一SQL、统一计算引擎的基础上,叠加AI与检索能力,整体架构可分为三层,完全兼容传统数仓能力,同时深度适配AI场景需求。

    2.1 统一存储层:多模态数据一体化存储

    Doris For AI 打破传统数仓仅支持结构化数据的局限,原生支持四类核心数据存储,适配AI全场景数据需求:

  • 结构化数据:维度、指标、业务明细数据,支撑传统OLAP多维分析;

  • 半结构化数据:原生超大JSON存储,支持100MB级超长文本、多轮对话日志、长文档数据,完美适配大模型长上下文场景;

  • 文本数据:支持分词、索引构建,适配全文关键词检索场景;

  • 向量数据:原生向量索引存储,支持高密度Embedding向量,适配语义检索、相似度匹配场景。

  • 所有数据统一存储在Doris表中,无需跨库同步,从根源解决数据冗余、一致性问题。

    2.2 统一计算层:HSAP混合计算引擎

    核心创新的HSAP混合搜索与分析处理引擎,实现三种检索能力+AI推理+结构化分析的无缝融合,支持单条SQL完成复杂AI联合查询:

    • 结构化SQL分析:聚合、分组、过滤、多维切片;

    • 全文检索:关键词匹配、分词检索、相关性打分;

    • 向量检索:语义相似度检索、KNN近邻匹配;

    • 库内AI推理:文本摘要、情感分析、信息抽取、Embedding生成等大模型能力。

    2.3 统一接口层:全SQL化AI能力

    Doris For AI 所有AI、检索能力均通过标准SQL暴露,无需学习新语法、无需对接复杂SDK,传统数仓开发者可零门槛上手,大幅降低AI应用开发门槛。

    三、Doris For AI 四大核心能力(4.0/4.1最新特性)

    结合Apache Doris官方最新版本特性,Doris For AI 核心能力集中在原生向量检索、智能AI函数、全文检索增强、超长文本AI适配四大模块,每一项能力均针对AI场景深度优化。

    3.1 高性能原生向量检索,替代独立向量数据库

    Doris 4.0起正式引入原生向量数据类型与向量索引,4.1版本完成性能规模化升级,完全具备企业级向量数据库能力:

    • 原生数据类型:支持VECTOR(N)类型,适配主流768维、1024维、2048维Embedding向量;

    • 多种向量索引:支持FLAT、IVF、IVF_ON_DISK等索引类型,兼顾精准检索与海量数据性能,适配离线精准查询与在线实时检索场景;

    • 核心优化:新增Ann Index Only Scan优化,大幅降低向量检索IO开销,海量向量数据检索性能提升30%+;

    • 向量计算函数:原生支持余弦相似度、欧氏距离、点积计算,无需出库即可完成向量相似度匹配。

    核心价值:无需部署独立向量数据库,业务数据入库Doris后直接生成向量索引,一站式完成向量存储与检索。

    3.2 库内AI函数,SQL直接调用大模型推理

    这是Doris For AI 最核心的创新能力,彻底颠覆传统AI数据处理链路。传统架构中,数据需要从数仓导出、调用大模型接口、再将结果回写存储,链路繁琐且效率低下。而Doris For AI 支持SQL直接调用大模型,在库内完成AI推理。

    主流内置AI函数覆盖绝大多数NLP场景:

    • EMBEDDING():文本向量化,自动生成向量嵌入,用于RAG知识库构建;

    • SENTIMENT():情感分析,识别文本正向/负向/中性情绪,适配评论治理、舆情分析;

    • SUMMARIZE():长文本摘要生成,适配文档解析、对话总结场景;

    • EXTRACT():关键信息抽取,自动提取文本中的时间、人物、关键词、实体信息;

    • TRANSLATE():文本翻译,支持多语言互转。

    核心优势:数据不出库、零代码胶水、链路极简,极大简化AI数据处理流程,提升数据处理实时性。

    3.3 全文检索+向量检索混合能力(HSAP核心)

    单一向量检索存在语义漂移、精准度不足问题,单一关键词检索无法理解语义。Doris For AI 融合全文检索+向量语义检索+结构化过滤的混合检索能力,支持单SQL完成多维精准检索:

    • 关键词检索保障内容精准召回,规避语义匹配偏差;

    • 向量检索保障语义关联,实现模糊需求、同义内容匹配;

    • 结构化条件过滤时间、分类、标签等维度数据,进一步提升检索精准度。

    4.1版本进一步优化检索打分机制,支持自定义权重配比,适配不同业务的检索优先级需求,是企业级RAG应用的最优检索方案。

    3.4 超长上下文AI适配,支撑大模型全链路场景

    针对大模型多轮对话、超长文档解析的刚需场景,Doris 4.1完成重磅升级:原生支持100MB级超大JSON存储,彻底突破数据库+大模型的上下文壁垒。可完整存储多轮对话生命周期数据、超长行业文档、知识库全景数据,完美适配长文本RAG、Agent智能交互、大规模知识库管理场景。

    四、Doris For AI 实战SQL案例

    为方便开发者快速落地,本文整理RAG场景高频实战SQL,涵盖表结构创建、向量生成、混合检索、AI文本处理核心场景。

    步骤 1:创建 AI 资源

    https://platform.deepseek.com/usagehttps://platform.deepseek.com/usage

    drop resource 'deepseek_example';

    CREATE RESOURCE 'deepseek_example'
    PROPERTIES (
    'type' = 'ai',
    'ai.provider_type' = 'deepseek',
    'ai.endpoint' = 'https://api.deepseek.com/chat/completions',
    'ai.model_name' = 'deepseek-chat',
    'ai.api_key' = 'sk-371**********************d51'
    );

    步骤 2:设置默认资源(可选)

    设置默认资源后,调用 AI 函数时无需显式指定资源名称:

    SET default_ai_resource = 'deepseek_example';

    步骤 3:在 SQL 中调用 AI 函数

    入门示例 :候选人简历与岗位需求的语义匹配模拟招聘场景中的候选人简历表与岗位需求表:

    CREATE TABLE candidate_profiles (
    candidate_id INT,
    name VARCHAR(50),
    self_intro VARCHAR(500)
    )
    DUPLICATE KEY(candidate_id)
    DISTRIBUTED BY HASH(candidate_id) BUCKETS 1
    PROPERTIES (
    "replication_num" = "1"
    );

    CREATE TABLE job_requirements (
    job_id INT,
    title VARCHAR(100),
    jd_text VARCHAR(500)
    )
    DUPLICATE KEY(job_id)
    DISTRIBUTED BY HASH(job_id) BUCKETS 1
    PROPERTIES (
    "replication_num" = "1"
    );

    INSERT INTO candidate_profiles VALUES
    (1, 'Alice', 'I am a senior backend engineer with 7 years of experience in Java, Spring Cloud and high-concurrency systems.'),
    (2, 'Bob', 'Frontend developer focusing on React, TypeScript and performance optimization for e-commerce sites.'),
    (3, 'Cathy', 'Data scientist specializing in NLP, large language models and recommendation systems.');

    INSERT INTO job_requirements VALUES
    (101, 'Backend Engineer', 'Looking for a senior backend engineer with deep Java expertise and experience designing distributed systems.'),
    (102, 'ML Engineer', 'Seeking a data scientist or ML engineer familiar with NLP and large language models.');

    通过 AI_FILTER 对岗位需求与候选人简介进行语义匹配,筛选出合适的候选人:

    SELECT
    c.candidate_id, c.name,
    j.job_id, j.title
    FROM candidate_profiles AS c
    JOIN job_requirements AS j
    WHERE AI_FILTER(CONCAT(
    'Does the following candidate self-introduction match the job description?',
    'Job: ', j.jd_text, ' Candidate: ', c.self_intro
    ));

    ERROR 1105 (HY000): errCode = 2, detailMessage = Can not build function: 'AI_FILTER', expression: AI_FILTER(concat('Does the following candidate self-introduction match the job description?', 'Job: ', jd_text, ' Candidate: ', self_intro)), Please specify the AI Resource in argument or session variable.

    使用 Datagrip 不支持 AI 语法,需要在黑窗口运行此语句

    如果报以上错误,需要先执行AI Resource

    SET default_ai_resource = 'deepseek_example3';

    此处的这个名字,一定要跟你创建的Resource的名字一样,否则,也报错

    假如报如下错误:

    ERROR 1105 (HY000): errCode = 2, detailMessage = (hadoop12)[HTTP_ERROR]error setting certificate verify locations: CAfile: /etc/ssl/certs/ca-certificates.crt CApath: none, url=https://api.deepseek.com/v1/

    说明是 CA 证书的问题:(目前无解,一直报证书错误,找不到)在每个节点上,安装证书。

    curl https://curl.se/ca/cacert.pem -o /etc/ssl/certs/ca-certificates.crt
    chmod 644 /etc/ssl/certs/ca-certificates.crt

    返回结果:

    +————–+——-+——–+——————+
    | candidate_id | name | job_id | title |
    +————–+——-+——–+——————+
    | 3 | Cathy | 102 | ML Engineer |
    | 1 | Alice | 101 | Backend Engineer |
    +————–+——-+——–+——————+

    4.1 创建AI知识库向量表

    创建支持文本、向量、结构化属性的混合数据表,适配RAG知识库存储:

    CREATE TABLE IF NOT EXISTS ai_knowledge_base (
    id BIGINT AUTO_INCREMENT,
    doc_title VARCHAR(512) COMMENT '文档标题',
    doc_content TEXT COMMENT '文档正文',
    doc_vector VECTOR(768) COMMENT '文档768维向量',
    doc_type TINYINT COMMENT '文档类型:1-技术文档 2-业务规范',
    create_time DATETIME DEFAULT CURRENT_TIMESTAMP
    )
    DUPLICATE KEY(id)
    DISTRIBUTED BY HASH(id) BUCKETS 8
    PROPERTIES (
    "replication_allocation" = "tag.location.default: 1",
    "enable_vector_index" = "true",
    "vector_index_type" = "IVF"
    );

    4.2 库内批量生成文本向量(AI函数实战)

    无需外部脚本,直接通过SQL将文本转为Embedding向量,批量构建知识库向量索引:

    UPDATE ai_knowledge_base
    SET doc_vector = EMBEDDING(doc_content)
    WHERE doc_vector IS NULL;

    4.3 向量相似度检索(RAG核心召回)

    根据用户提问文本,实时生成向量并召回相似知识库内容:

    SELECT
    id,
    doc_title,
    doc_content,
    COSINE_SIMILARITY(doc_vector, EMBEDDING('Doris For AI如何实现混合检索')) AS score
    FROM ai_knowledge_base
    WHERE doc_type = 1
    ORDER BY score DESC
    LIMIT 5;

    4.4 全文+向量混合检索(精准RAG召回)

    结合关键词精准匹配+语义相似度,解决单一检索精准度不足问题:

    SELECT
    id,
    doc_title,
    doc_content,
    COSINE_SIMILARITY(doc_vector, EMBEDDING('Doris AI函数使用方法')) AS vector_score
    FROM ai_knowledge_base
    WHERE MATCH(doc_content, 'AI函数 大模型推理')
    AND doc_type = 1
    ORDER BY vector_score DESC
    LIMIT 3;

    4.5 库内AI文本处理(摘要+情感分析)

    SELECT
    id,
    doc_title,
    SUMMARIZE(doc_content) AS doc_summary,
    SENTIMENT(doc_content) AS sentiment_result
    FROM ai_knowledge_base
    LIMIT 10;

    五、Doris For AI 核心落地场景

    目前Doris For AI 已在字节跳动、思必驰等多家企业生产落地,覆盖AI全链路场景,核心落地场景如下:

    5.1 轻量化企业RAG知识库

    替代传统“ES+向量库+数仓”架构,单Doris集群实现知识库存储、文本解析、向量生成、混合检索、结果分析全流程能力,适配企业内部文档问答、智能客服、行业知识库检索场景,大幅降低RAG项目落地成本。

    5.2 AI特征工程与训练数据治理

    基于Doris湖仓一体能力,实现AI训练数据的实时清洗、特征提取、样本筛选,通过库内AI函数自动生成文本特征、统计特征,无需数据出库,高效完成AI模型训练数据准备,适配推荐、风控、NLP模型训练场景。

    5.3 实时内容治理与舆情分析

    针对用户评论、社交文本、舆情数据,实时入库后通过AI函数完成情感分析、违规信息抽取、内容摘要,结合多维分析能力实现实时舆情监控、内容风控、热点分析。

    5.4 大模型Agent交互日志分析

    依托100MB级超长文本存储能力,完整存储Agent多轮交互日志,通过混合检索复盘对话流程,结合结构化分析统计对话命中率、问答准确率、异常场景,实现大模型应用的可观测、可优化。

    六、Doris For AI 架构核心优势

    6.1 架构极简,降本增效

    多组件合一,减少向量数据库、搜索引擎两套独立集群部署,降低30%+服务器存储成本、50%+运维开发成本,中小团队可快速落地AI应用。

    6.2 链路极致精简,实时性更强

    数据入库即处理、检索、分析,无需跨组件数据同步与调用,查询链路延迟大幅降低,完美适配在线实时AI问答、低延迟智能检索场景。

    6.3 零门槛开发,SQL赋能AI

    所有AI能力、检索能力均基于标准SQL实现,传统数仓开发者无需学习AI框架、向量库语法,快速转型AI数据开发。

    6.4 数据统一,一致性更高

    结构化、文本、向量数据统一存储,单源数据杜绝多副本数据不一致、同步延迟问题,数据可靠性大幅提升。

    七、未来演进(2026 Doris Roadmap)

    根据Apache Doris官方2026 roadmap,Doris For AI将持续深化AI能力,核心迭代方向包括:

  • 强化多模态AI能力,支持图片、音频向量检索,覆盖全模态AI场景;

  • 优化AI函数性能,支持批量推理、模型缓存,大幅提升库内AI计算效率;

  • 完善MCP智能交互能力,深度适配大模型Agent自动化调度场景;

  • 优化海量向量数据分布式检索性能,支撑亿级、十亿级向量规模化部署。

  • 八、总结

    Doris For AI 的诞生,标志着Apache Doris从传统实时OLAP数仓,全面升级为AI时代一站式数据基础设施。通过HSAP混合架构、原生向量检索、库内AI推理、超长文本适配四大核心能力,彻底解决了传统AI数据架构碎片化、高成本、高延迟、难维护的痛点。

    对于开发者而言,无需搭建复杂的多组件集群,仅靠一套Doris集群,即可完成数据存储、特征工程、智能检索、AI推理、多维分析全链路AI数据处理,是当前轻量化、低成本、高性能落地RAG、AI分析、智能交互场景的最优方案之一。随着版本持续迭代,Doris将进一步深度融合AI能力,成为企业AI应用的核心数据底座。

    赞(0)
    未经允许不得转载:171主机测评 » Apache Doris For AI:一站式AI数据底座,重构RAG与智能分析架构(Doris4.X)
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址