正在载入数据

0%

玄幂 Xenomi 开源领域模型家族视觉标识

玄幂 · 领域大模型家族

国光量子 / 开源大语言模型

充分发挥量子计算优势,聚焦尖端科技研究和学术领域的大语言模型

玄幂大模型是中科国光量子在人工智能领域的又一项重要突破。我们探索量子计算在混合决策与低时延推理中的应用,为科研学术场景提供可私有化部署、可审计的智能能力。1

交互问答

演示模式

演示模式,响应由本地示例生成。选一条预设,或自己输入问题。

Enter 发送

产品家族

覆盖多种部署形态,满足不同工作负载。

不同规模对应不同部署条件与工作负载,覆盖端侧低延迟、科研摘要与多文档处理。

XENOMI-NANO

端侧判别

0.8B

端侧判别与术语抽取

部署形态
端侧 / 低延迟
Q4 显存
~1 GB
上下文窗口
262K

XENOMI-MINI

科研与科普

4B

科研摘要、科普表达与产品判断

部署形态
单卡 24 GB
Q4 显存
~3 GB
上下文窗口
262K

XENOMI-PRO

长文与综述

27B Dense

长文组织、标书技术章与多文档综述

部署形态
工作站 / 单机
Q4 显存
~16 GB
上下文窗口
262K

XENOMI-MAX

Agent 与材料

122B / 10B 激活

整册材料、多轮 Agent 与机房级任务

部署形态
多卡机房
Q4 显存
~70 GB
上下文窗口
262K

应用场景

围绕专业工作,覆盖核心应用。

  • 科研与科普

    科研内容理解

    覆盖结构化摘要、科普要点与内容风险识别,支持专业信息的整理、表达与审核。

  • Agent 决策

    智能体决策

    覆盖风险判断、工具选择与结束判定,为智能体提供明确的执行边界。

  • 端侧判别

    端侧轻量推理

    适用于路由、关键词识别与术语抽取等低延迟任务,满足设备侧快速响应需求。

  • 材料工作

    文档生产

    支持公文、标书与内容润色,保留证据与引用线索,便于团队复核与持续复用。

性能指标

质量与响应效率,一图呈现。

从端侧判别到科研内容处理,玄幂覆盖路由、术语抽取、风险判断与科普表达;轻量路径负责快速筛选,科研路径承担摘要与知识表达。短判断不必走完整生成,量子头把路由等待压到 15.6 ms ,相对生成式路径约快 20×134

散点图同时呈现任务表现与端到端等待。横轴越向右响应越快,纵轴位置越高表示任务分数越高。1

速度 × 质量 15ms 50ms 100ms 200ms 300ms 500ms 1s 2s 端到端等待(1000 / P50 ms) 路由表现(%) Qwen3.5-0.8B,30,P50 464 ms Qwen3.5-0.8B 玄幂-0.8B,91.2,P50 316 ms 玄幂-0.8B 玄幂-0.8B 量子头,96.2,P50 15.6 ms 玄幂-0.8B 量子头 Qwen3.5-4B,70,P50 2265 ms Qwen3.5-4B 玄幂-4B,95,P50 1395 ms 玄幂-4B
速度 × 质量 1s 2s 6s 端到端等待(1000 / P50 ms) 科普关键点(%) Qwen3.5-4B,14.6,P50 6589 ms Qwen3.5-4B 玄幂-4B 科研,41.7,P50 1229 ms 玄幂-4B 科研
速度 × 质量 200ms 300ms 500ms 1s 端到端等待(1000 / P50 ms) 短文本 Acc(%) Qwen3.5-0.8B,55,P50 199 ms Qwen3.5-0.8B 玄幂-0.8B,100,P50 236 ms 玄幂-0.8B Qwen3.5-4B,76.2,P50 636 ms Qwen3.5-4B 玄幂-4B,100,P50 946 ms 玄幂-4B

基础模型 玄幂 量子头

0

内容风险 F1

4B 内容风险

0 %

路由准确率

4B 产品路由

0 ×

量子头路由

相对生成式路由

0 %

身份一致性

0.8B FAQ

路由稳定,任务才能进入正确的工具链和产品路径。术语与实体结构化后,可直接进入检索、判断与后续流程。短文本分类达到 100.0 ,让轻量审核前置到入口。1

0.8B 任务表现 1

Classic5 同口径。

模型 路由 Acc RAG Acc 5 NER F1 关键词 F1 短文本 Acc
基座模型 30.081.231.921.455.0
玄幂-0.8B 91.277.573.786.4100.0
优势 +204.0%-4.6%+131.0%+303.7%+81.8%

4B 任务表现 1

产品轨 Classic5。

模型 路由 Acc RAG Acc 5 NER F1 关键词 F1 短文本 Acc
基座模型 70.087.550.421.876.2
玄幂-4B 95.085.078.160.5100.0
优势 +35.7%-2.9%+55.0%+177.5%+31.2%

内容风险被转成可执行的审核边界,风险识别 F1 达到 100.0 。科普回答不只追求流畅,更覆盖必须讲清的科学要点;回答更短、更贴结构,科普等待降至约 1.2 s ,适合进入可对话的产品流程。14

任务表现 1

路由 RAG NER 关键词 短文本

含 RAG 回退。

摘要槽位 摘要 must 科普 must Format 风险 F1

4B 雷达为科研轨,上表为产品轨。

基础模型 玄幂

端到端等待 4

200ms 500ms P50 路由 RAG NER 关键词 短文本

生成吞吐(tokens/s)

0 89 177 路由 RAG NER 关键词 短文本
500ms 1s 2s 4s 8s P50 摘要 科普 Format 风险

生成吞吐(tokens/s)

0 17 33 摘要 科普 Format 风险
500ms 1s 2s P50 路由 RAG NER 关键词 短文本

生成吞吐(tokens/s)

0 14 28 路由 RAG NER 关键词 短文本

基础模型 玄幂

问题重编码 LoRA 末 token hidden 投影为耦合矩阵 J
量子退火 / QAIA 以 Ising / QUBO 能量面搜索低能态
混合量子-经典 大模型负责表征,退火处理离散子问题,经典层校验
能量面读出 目标、耦合与约束映射到路由或风险

量子决策

让量子退火进入 AI 的离散决策层。

玄幂大模型让量子退火参与 AI 决策,把复杂判断转化为更快、更清晰的路径选择。大模型负责理解语义,量子方法负责做出选择,适合路由与风险判断等短任务。

末 token hidden 耦合矩阵 J Ising / QAIA 路由读出

量子头面向只需输出一个判断的任务,用读出替代逐 token 生成。0.8B 路由等待从 316 ms 降到 15.6 ms,相对生成式路径约快 20×,判断准确率 96.2%3

Agent 决策指标 11

智能体要能拦住风险、选对工具、知道何时结束。三项相对 基座模型 对照。

0% 50% 100% 风险决策 +38.5% 工具决策 +2.9% 结束决策 +37.5%

基座模型 玄幂-4B

0.8B 路由决策 3

路由只要一个去向。生成式路径把判断写成文字再解析;量子头在隐状态上做读出,直接给出去向。判断更稳,等待从数百毫秒收到十几毫秒。

判断准确率

生成式路由 91.2 量子头读出 96.2 +5.0 0 50 100

端到端等待 P50

生成式路由 316 ms 量子头读出 15.6 ms 20× 0 100 200 300

同一窗口内的读出次数

一次生成式路由等待里,量子头大约可以完成 20 次读出。

生成式一次 316 ms 量子头 ×20 15.6 ms

生成式路由 量子头读出

量子随机数

让模型负责推理,让熵源负责不可预测。

QRNG 将量子物理熵接入 LLM 的采样与安全链路,守住私有化部署从生成到密钥的随机性边界。6

约 0.7 cm³

芯片体积

量子熵源可嵌入设备

10 Gbps 以上

熵源输出速率

覆盖推理与密码服务

99.6% 至 100%

采样注入率(PRNG)

SeedHijack 类攻击对照

0%

采样注入率(QRNG)

独立物理熵源路径

+0.6%

中位采样延迟开销

接入安全边界的代价

不同随机数方案,信任边界不同。

LLM 每次生成 token 都要从概率分布中抽样。真正需要比较的不是输出看起来是否随机,而是熵源能否被复现、替换和审计。

  • PRNG 可复现算法
    随机性来源

    由种子经过确定性算法扩展,同一种子可以重演同一条序列。

    劣势

    状态或调用链一旦被预测、替换,采样结果就可能被操控。

  • CSPRNG 计算安全
    随机性来源

    以高质量种子进行确定性扩展,在计算假设下抵抗预测。

    劣势

    软件实现与调用链仍需单独审计,算法强度不等于硬件隔离。

  • TRNG / HRNG 物理噪声
    随机性来源

    从热噪声、时钟抖动等物理过程提取熵,依赖后处理与健康检测。

    劣势

    物理源、环境稳定性、驱动与后处理共同决定可信度。

私有化部署,把量子熵放进玄幂的安全边界。

玄幂可将量子随机数芯片接入本地熵池与 KMS。推理采样、Agent 会话密钥和工具 nonce 按策略消费熵源,模型与数据留在内网。

安全性来自独立硬件信任边界,可靠性来自健康检测、熵池、HRNG 降级与审计的组合。

量子随机数芯片 真空涨落熵源
熵池 / KMS 扩展、轮换与审计
玄幂运行时 采样、Agent、DP / FL
PQC 网关与边缘 端网云安全协同

从采样安全,延展到 AI + 量子基础设施。

从模型运行时到行业终端,QRNG 可以沿着安全、隐私与随机采样的接口持续复用。

  • 推理采样

    在 logits 计算后接入 QRNG,降低 PRNG 供应链被操控的风险,让模型负责语义推理,熵源负责不可预测性。

  • Agent 与企业应用

    工具调用 nonce、会话密钥、OAuth state 与多路径探索由 QRNG / KMS 提供,适合政务、金融与关基内网。

  • 隐私训练与科研

    预训练保留可复现路径,DP / FL 微调、蒙特卡洛与抽样解释接入外置熵源,随机过程更易追溯。

  • 生成式与多模态

    temperature、RAG 候选重排、扩散模型与 VAE / GAN 噪声共享随机性问题,QRNG 可沿采样接口延展。

  • PQC 与端网云

    PQC + QRN 高速密码卡、综合加密网关与移动加密模组,把量子熵前移到服务器、园区与移动终端。

  • AI 稽核与安全运营

    AI 可辅助检测熵源漂移、尖峰与降级事件,把 QRNG 健康状态接入网关、SIEM 与合规审计,形成可观测的安全闭环。

更多信息

从自家产品,走到行业现场。

玄幂先进入国光量子的科研与知识产品,再以私有化部署对接行业场景。模型、语料与日志留在客户边界内。

玄幂已经应用在以下产品中

  • 量子智能实验平台

    科研全流程

    把自然语言需求接到真实量子计算任务。文献检索、混合编程、机时提交与结果回收走同一条链路,玄幂负责领域理解与材料生成。

  • 夸米

    多智能体操作系统

    文献、实验策划、编程、调度与分析由多个智能体接力。玄幂作为领域模型底座,让协作链路识别量子术语、实验约束与报告规范。

  • 量库知识平台

    领域知识

    面向量子与科研材料做检索、摘要与可追溯问答。模型与语料留在可控环境,引用线索可复核。

私有化部署

推理、语料与日志不出域。按任务选择端侧、工作站或机房档位,对接现有网关、KMS 与运维流程。

  • 端侧
  • 工作站
  • 机房

安全边界

独立硬件熵源进入采样与密钥。会话、工具调用与 nonce 可审计,访问权限由客户掌控。 10

  • 采样
  • 密钥
  • 会话
  • 审计

按行业与场景合作

围绕任务与数据边界,为每个场景匹配合适的模型与部署形态,让推理、审计与运维留在内网。

电力调度记录理解、运行规程问答、风险判别。
能源工况文档整理、巡检材料、决策摘要。
安全内网 Agent、策略问答、审计材料。
数据分类与抽取、知识沉淀、材料复核。
交通规程理解、事件摘要、调度辅助。

开放资源

获取玄幂开源模型资源。

采用 Apache 2.0 许可。XENOMI-NANO 与 XENOMI-MINI 已完成训练,XENOMI-PRO 与 XENOMI-MAX 正在按产品规划推进。

  • GitHub 仓库 即将开放
  • Hugging Face 组织 即将开放
  • XENOMI-NANO 即将开放
  • XENOMI-MINI 即将开放

数据说明

  1. 1.

    页面数字来自已冻结的交付报告。0.8B 主要结果来自 mlx-m5(2026-07-28);4B 主结果来自 RTX 5070、CUDA、bf16 LoRA(2026-08-06)。Agent 决策三项为 llama.cpp BF16 同口径,见第 11 条。日期、硬件、运行栈与任务口径属于结果的一部分,不能脱离实验条件单独解读。

  2. 2.

    相对 Qwen3.5 基座的主要准确率提升来自垂类数据与 LoRA / SFT。量子头的主链路为 LoRA 末 token hidden → 投影/耦合 J → 线性、Ising 或 QAIA 读出,用于混合读出、能量面与更短的路由等待,页面不将其表述为「量子硬件优越性」。

  3. 3.

    4B Scheme-C 的 linear、ising_classic、qaia 三种读出均为 87.5%,与线性头相差 0 pt,默认交付不受影响。0.8B CUDA 对照中,Ising 路由为 91.2,使用同一特征的 linear 为 83.8。

  4. 4.

    部分任务的端到端等待有所缩短。4B 科普 P50 约从 6.6 s 降到 1.2 s,路由约从 2.3 s 降到 1.4 s,主要来自更短、更规范的生成。4B adapter 生成吞吐约为 18-23 tokens/s,基座约为 21-29,不宣称原始推理吞吐提升。

  5. 5.

    部分任务存在结果回落:0.8B RAG 准确率从 81.2 降到 77.5,4B 摘要关键点从 50.0 降到 45.8,历史 RAG 从 87.5 降到 85.0。

  6. 6.

    QRNG 提供独立物理熵,公开材料中的真空涨落芯片约 0.7 cm³、10 Gbps 量级;它服务随机性与采样安全,不是 Xenomi 任务准确率的来源。SeedHijack 注入率与 QRNG 防御数字来自公开文献,不是本仓评测。

  7. 7.

    页面将路由、NER、关键词、短文本、摘要、科普与风险等任务分别呈现。Acc / F1 是对应任务指标,不能相加为总分,也不等同于通用智能能力。

  8. 8.

    端到端等待以 P50 毫秒表示,散点横轴使用 1000 / P50(ms),不是 tokens/s。不同型号的硬件与运行栈不同,绝对毫秒只用于各自对照,不代表同机横向结论。

  9. 9.

    模型家族包含 0.8B、4B、27B 与 122B-A10B;当前交付评测为 0.8B 与 4B,27B / 122B-A10B 仍是规格规划,不纳入散点与分数比较。

  10. 10.

    私有化部署可将量子随机数芯片接入熵池、KMS 与运行时采样器,配合健康检测、HRNG 降级、AI 稽核与安全网关形成可审计链路;这是部署方案说明,不构成已完成的全量生产验证。

  11. 11.

    Agent 决策三项来自 llama.cpp BF16(2026-08-18),与当场转出的 Qwen3.5-4B 基座同口径:风险决策 57.4→95.9,工具决策 92.5→95.4,结束决策 33.3→70.8。CUDA PEFT 历史口径为 93.7 / 96.4 / 83.3,页面不把两条运行栈写成同一组分数。

  12. *.

    LoRA 需要与对应的 Qwen3.5 基座一起加载。许可为 Apache 2.0。Hugging Face 与 GitHub 地址通过环境变量注入,尚未配置时页面显示「即将开放」。