四川慧途智联科技有限公司 (品牌 HTZL.AI) 成立于人工智能基础设施浪潮兴起之际,是国内领先的企业级私有 AI 基础设施提供商及行业赋能者。HTZL.AI 是一家 AINative 的科技公司 —— 从模型部署、RAG 知识引擎、多工具 Agent 编排、API 网关到企业级管理控制台与授权许可系统,全栈软件均为自主研发;其研发流程本身也由 AI 驱动,搭建于 NVIDIA DGX Spark 自托管 CI/CD 流水线之上,后端已沉淀 2,300 自动化测试,形成“用 AI 造 AI”的工程闭环。HTZL.AI 主打“数据不出企业、模型不进云端”的私有化 AI 路径,已在环保咨询机构、出海企业等数据敏感行业落地。
垂直企业级私有AI技术,攻破“120B 大模型必须上云”的核心问题
HTZL.AI自成立之初就将研发重心放在“让企业级大模型真正进入企业内部”这一核心命题上。区别于调用公有云API的轻量套壳方案,HTZL.AI自研了完整的私有化技术栈:开放内核 (open-core) 架构、混合检索RAG引擎、基于LangGraph的Agent编排、sk-htzl-*计费网关、多租户管理控制台。
这套系统全部搭载于 NVIDIA DGX Spark (GraceBlackwell 架构、128 GB统一内存) 单机之上,实现了在客户自有办公室/机房内对大模型推理、向量检索、业务数据与 Agent 编排的全方位自主掌控 —— 数据全程不出企业、推理结果带原文引用、每一次调用可计量可审计。
HTZL.AI智能问答控制台 —— 多租户私有知识库
HTZL.AI的企业控制台支持单台NVIDIA DGX Spark同时承载多个相互隔离的租户 (site_key隔离),每租户拥有独立的向量库collection ({site_key}_context)、独立配额、独立审计日志,并在PostgreSQL层以行级安全 (RLS),相当于把“一朵小型企业AI私有云”装进了客户自家的办公室。
数据 AI 引擎 —— 每一次请求都是飞轮的燃料
HTZL.AI已构建企业级AI数据引擎:每一次交互 (对话、token用量、模型时延、错误率、用户反馈、知识盲点) 都被完整持久化进PostgreSQL,形成数据全流程高效闭环。在NVIDIA DGX Spark高容量统一内存与NVIDIA CUDA计算栈的加持下,海量交互数据被自动化处理 —— 这些数据今天驱动企业运营看板,明天即可驱动模型微调与检索策略迭代,让私有AI的智能化与自主化能力持续演进。
怀揣“数据不出企业”的愿景,研发企业级私有AI三大产品线
HTZL.AI自成立以来,始终坚持“让AI真正属于企业自己——可信、可控、可审计”的愿景,致力于企业级私有AI基础设施的研发,形成三大产品线:“物理可控的GPU工作站算力底座、精细可审计的AI基础设施中枢、以及数据绝对可信的行业SaaS业务平台”三大产品线,为企业交付端到端的全栈私有化AI闭环解决方案。
企业级私有AI的全新挑战
随着大模型在企业场景快速渗透,落地场景正由“公有云 SaaS”扩展至“客户办公室/机房内的私有化部署”。不同于公有云场景,私有化部署对系统提出了全新挑战:业务要拥抱 120B 级大模型,但律师手中的合同与诉讼材料、生物公司的专利与配方、出海企业的客户名单与跨境股权结构,任何一份外泄都意味着商业泄密甚至法律责任,绝不能在公有云大模型中被分析、缓存乃至训练。过去要在企业内部部署一个 Qwen3.6 同等水准的大模型,往往意味着购置数十张高端 GPU、搭建液冷机房、组建 MLOps 团队,初期投入数百万人民币 —— 这对绝大多数中小企业是无法承受之重。
为实现安全可靠的私有化推理,HTZL.AI 需要一种单机即可承载完整 AI 栈的计算平台,用于多模型共存、向量检索与 Agent 编排的本地部署。最终团队在对比多卡工作站方案后,选择 NVIDIA DGX Spark 作为单机部署底座,提供媲美高端算力中心的高性价比方案。NVIDIA Grace Blackwell 架构提供 128GB CPU/GPU 统一内存,提供了更大容量的模型加载能力;丰富的 NVIDIA 软件生态 (CUDA、TensorRT-LLM) 则为多模型推理与向量并行计算提供了高质量算力支持。
HTZL.AI采用的NVIDIA产品
在选择NVIDIA产品生态作为底座后,HTZL.AI充分利用了NVIDIA硬件与软件解决方案的多样性与强大性能,具体采用了以下NVIDIA产品:
NVIDIA DGX Spark/Grace Blackwell 平台:128 GB统一内存让三个模型在一台设备上稳定共存 —— Qwen3.5-122 B 主推理模型 (FP4量化、约65 GB,默认常驻)、Qwen3-Embedding-4 B 中英混合嵌入模型 (Q8量化、约5.4 GB、2560维向量,默认常驻)、Qwen-VL-视觉理解模型 (约14GB,按需启用)。三模型满载约82.9GB,仍为系统与批处理缓存预留约45 GB余量。CPU与 GPU共享内存让单机即可完成“召回→融合→重排→生成”的全链路RAG推理,从架构上彻底消除了多机调度开销。
NVIDIACUDA:Milvus向量检索、BM25稀疏召回与嵌入模型推理全部跑在CUDA 加速通路上。HTZL.AI 的混合检索引擎以稠密向量召回 BM25稀疏召回并行执行,经RRF倒数排名融合 (k=60) 合并,再由 Cross-encoder重排模型 (BAAI/bge-reranker-v2-m3) 精排,输出带“源文件 页码 段落”三级引用的检索结果;单租户查询端到端 P95控制在数百毫秒级。
llama.cpp onNVIDIACUDA 推理后端:Qwen3.5-122 B 与 Qwen3-Embedding-4 B 经 llama.cpp 的 CUDA后端 (FlashAttention、prompt缓存、连续批处理) 对外稳定提供SSE流式输出,首token通常在1秒内返回,支持企业内部数十名活跃用户同时对话与文档问答。SSE事件流实时下发token、工具调用状态与引用列表,让客户在浏览器上“边读边等”。
NVIDIATensorRT-LLM:视觉理解模型Qwen-VL – 已基于TensorRT-LLM (PyTorch后端) 在NVIDIADGX Spark上部署,作为Agent 的explain_image工具,让系统能够直接读懂扫描合同、判例图表、证照影像等非结构化图像内容。后续将进一步把主模型token流迁移至TensorRT-LLM以压低首token延迟。

标杆落地:HTZL.AI租户Molycure,让中国企业出海拥有“24 小时在线的合规专家”
Molycure是运行在HTZL.AI平台之上的旗舰垂直租户 —— 国内首批面向“中国企业出海”场景的垂直行业AIAgent。借助HTZL.AI的多租户私有架构,Molycure在一套NVIDIADGX Spark上整合了东南亚、欧盟、北美、中东等高频出海目的地的法规、税务、签证、知识产权与数据合规专业文档,覆盖18 个出海垂直领域、194 权威数据源、数十万向量片段,整体源召回率达到100%。

在具体业务环节中,NVIDIA 计算平台发挥了重要作用:通过 NVIDIA DGX Spark128 GB统一内存,Molycure 的“召回→融合→重排→中文回答”全链路在单机完成,单次跨境合规咨询从传统“对每个国家聘请一家律所、平均 3天等回邮件”缩短至分钟级;通过NVIDIACUDA 加速的批量文档摄入流水线,单次客户专属知识库 (私密会议文档、合同库、董事会决议、海外注册材料) 的全量灌库时间从多机方案的数小时缩短至单机十几分钟。架构层面,molycure前端部署在Vercel全球边缘,经Cloudflare Tunnel安全反向接入本地 NVIDIA DGX Spark,对外只暴露HTTPS,无任何公网IP与入站端口 —— 这对存放着客户跨境资产与股权信息的“出海大脑”而言,是企业级数据安全的最低门槛。
业务价值:把“上云才能用 AI”的旧逻辑彻底翻转
依托 NVIDIA DGX Spark,HTZL.AI 为出海企业、律所、生物科技等数据敏感客户带来了显著优势。在成本与能耗方面,客户硬件投入相比多卡 GPU 工作站降低约 50%、能耗降低 90%以上;在合规属性方面,客户首次获得“数据不出企业、推理结果带引用、所有调用可审计”的强合规能力;在交付形态方面,整机功耗与一台高端笔记本相当,可直接摆进客户办公室。以旗舰租户 Molycure 为例,出海企业的年度海外顾问费从数十万元降至单台设备的硬件摊销 订阅费用,实现了一个数量级的成本压缩。

使用的NVIDIA技术包括:
NVIDIA DGXSpark (GraceBlackwell)、NVIDIACUDA、llama.cpp onCUDA (主模型/嵌入模型推理)、NVIDIATensorRT-LLM (Qwen-VL视觉模型,已落地)、NVIDIACUDA加速向量检索 (Milvus)、NVIDIANIM (规划中)
架构示意图

HTZL.AI–Architecture: Vercel → Cloudflare → Office (NVIDIA DGX Spark) LLM Inference
NVIDIA初创加速计划
四川慧途智联科技有限公司是NVIDIA初创加速计划会员企业。
NVIDIA初创加速计划 (NVIDIA Inception) 为免费会员制,旨在培养颠覆行业格局的优秀创业公司。该计划联合国内外知名的风投机构、创业孵化器、创业加速器、行业合作伙伴以及科技创业媒体等,打造创业加速生态系统。能够提供产品折扣、技术支持、市场宣传、融资对接、业务推荐等一系列服务,加速创业公司的发展。
免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com