私有化部署
推理、语料与日志不出域。按任务选择端侧、工作站或机房档位,对接现有网关、KMS 与运维流程。
- 端侧
- 工作站
- 机房
正在载入数据
0%
国光量子 / 开源大语言模型
充分发挥量子计算优势,聚焦尖端科技研究和学术领域的大语言模型
玄幂大模型是中科国光量子在人工智能领域的又一项重要突破。我们探索量子计算在混合决策与低时延推理中的应用,为科研学术场景提供可私有化部署、可审计的智能能力。1
交互问答
产品家族
不同规模对应不同部署条件与工作负载,覆盖端侧低延迟、科研摘要与多文档处理。
端侧判别
0.8B
端侧判别与术语抽取
科研与科普
4B
科研摘要、科普表达与产品判断
长文与综述
27B Dense
长文组织、标书技术章与多文档综述
Agent 与材料
122B / 10B 激活
整册材料、多轮 Agent 与机房级任务
应用场景
科研内容理解
覆盖结构化摘要、科普要点与内容风险识别,支持专业信息的整理、表达与审核。
智能体决策
覆盖风险判断、工具选择与结束判定,为智能体提供明确的执行边界。
端侧轻量推理
适用于路由、关键词识别与术语抽取等低延迟任务,满足设备侧快速响应需求。
文档生产
支持公文、标书与内容润色,保留证据与引用线索,便于团队复核与持续复用。
0
内容风险 F1
4B 内容风险
0 %
路由准确率
4B 产品路由
0 ×
量子头路由
相对生成式路由
0 %
身份一致性
0.8B FAQ
路由稳定,任务才能进入正确的工具链和产品路径。术语与实体结构化后,可直接进入检索、判断与后续流程。短文本分类达到 100.0 ,让轻量审核前置到入口。1
内容风险被转成可执行的审核边界,风险识别 F1 达到 100.0 。科普回答不只追求流畅,更覆盖必须讲清的科学要点;回答更短、更贴结构,科普等待降至约 1.2 s ,适合进入可对话的产品流程。14
量子决策
玄幂大模型让量子退火参与 AI 决策,把复杂判断转化为更快、更清晰的路径选择。大模型负责理解语义,量子方法负责做出选择,适合路由与风险判断等短任务。
量子头面向只需输出一个判断的任务,用读出替代逐 token 生成。0.8B 路由等待从 316 ms 降到 15.6 ms,相对生成式路径约快 20×,判断准确率 96.2%。3
路由只要一个去向。生成式路径把判断写成文字再解析;量子头在隐状态上做读出,直接给出去向。判断更稳,等待从数百毫秒收到十几毫秒。
判断准确率
端到端等待 P50
同一窗口内的读出次数
一次生成式路由等待里,量子头大约可以完成 20 次读出。
生成式路由 量子头读出
约 0.7 cm³
芯片体积
量子熵源可嵌入设备10 Gbps 以上
熵源输出速率
覆盖推理与密码服务99.6% 至 100%
采样注入率(PRNG)
SeedHijack 类攻击对照0%
采样注入率(QRNG)
独立物理熵源路径+0.6%
中位采样延迟开销
接入安全边界的代价LLM 每次生成 token 都要从概率分布中抽样。真正需要比较的不是输出看起来是否随机,而是熵源能否被复现、替换和审计。
由种子经过确定性算法扩展,同一种子可以重演同一条序列。
状态或调用链一旦被预测、替换,采样结果就可能被操控。
以高质量种子进行确定性扩展,在计算假设下抵抗预测。
软件实现与调用链仍需单独审计,算法强度不等于硬件隔离。
从热噪声、时钟抖动等物理过程提取熵,依赖后处理与健康检测。
物理源、环境稳定性、驱动与后处理共同决定可信度。
从真空涨落等量子测量获取熵,经后处理输出不可预测比特。
独立硬件信任边界,可服务推理采样、KMS 密钥与 nonce,并配合熵池、健康检测与审计。
玄幂可将量子随机数芯片接入本地熵池与 KMS。推理采样、Agent 会话密钥和工具 nonce 按策略消费熵源,模型与数据留在内网。
安全性来自独立硬件信任边界,可靠性来自健康检测、熵池、HRNG 降级与审计的组合。
从模型运行时到行业终端,QRNG 可以沿着安全、隐私与随机采样的接口持续复用。
在 logits 计算后接入 QRNG,降低 PRNG 供应链被操控的风险,让模型负责语义推理,熵源负责不可预测性。
工具调用 nonce、会话密钥、OAuth state 与多路径探索由 QRNG / KMS 提供,适合政务、金融与关基内网。
预训练保留可复现路径,DP / FL 微调、蒙特卡洛与抽样解释接入外置熵源,随机过程更易追溯。
temperature、RAG 候选重排、扩散模型与 VAE / GAN 噪声共享随机性问题,QRNG 可沿采样接口延展。
PQC + QRN 高速密码卡、综合加密网关与移动加密模组,把量子熵前移到服务器、园区与移动终端。
AI 可辅助检测熵源漂移、尖峰与降级事件,把 QRNG 健康状态接入网关、SIEM 与合规审计,形成可观测的安全闭环。
更多信息
玄幂先进入国光量子的科研与知识产品,再以私有化部署对接行业场景。模型、语料与日志留在客户边界内。
科研全流程
把自然语言需求接到真实量子计算任务。文献检索、混合编程、机时提交与结果回收走同一条链路,玄幂负责领域理解与材料生成。
多智能体操作系统
文献、实验策划、编程、调度与分析由多个智能体接力。玄幂作为领域模型底座,让协作链路识别量子术语、实验约束与报告规范。
领域知识
面向量子与科研材料做检索、摘要与可追溯问答。模型与语料留在可控环境,引用线索可复核。
推理、语料与日志不出域。按任务选择端侧、工作站或机房档位,对接现有网关、KMS 与运维流程。
围绕任务与数据边界,为每个场景匹配合适的模型与部署形态,让推理、审计与运维留在内网。
开放资源
采用 Apache 2.0 许可。XENOMI-NANO 与 XENOMI-MINI 已完成训练,XENOMI-PRO 与 XENOMI-MAX 正在按产品规划推进。
页面数字来自已冻结的交付报告。0.8B 主要结果来自 mlx-m5(2026-07-28);4B 主结果来自 RTX 5070、CUDA、bf16 LoRA(2026-08-06)。Agent 决策三项为 llama.cpp BF16 同口径,见第 11 条。日期、硬件、运行栈与任务口径属于结果的一部分,不能脱离实验条件单独解读。
相对 Qwen3.5 基座的主要准确率提升来自垂类数据与 LoRA / SFT。量子头的主链路为 LoRA 末 token hidden → 投影/耦合 J → 线性、Ising 或 QAIA 读出,用于混合读出、能量面与更短的路由等待,页面不将其表述为「量子硬件优越性」。
4B Scheme-C 的 linear、ising_classic、qaia 三种读出均为 87.5%,与线性头相差 0 pt,默认交付不受影响。0.8B CUDA 对照中,Ising 路由为 91.2,使用同一特征的 linear 为 83.8。
部分任务的端到端等待有所缩短。4B 科普 P50 约从 6.6 s 降到 1.2 s,路由约从 2.3 s 降到 1.4 s,主要来自更短、更规范的生成。4B adapter 生成吞吐约为 18-23 tokens/s,基座约为 21-29,不宣称原始推理吞吐提升。
部分任务存在结果回落:0.8B RAG 准确率从 81.2 降到 77.5,4B 摘要关键点从 50.0 降到 45.8,历史 RAG 从 87.5 降到 85.0。
QRNG 提供独立物理熵,公开材料中的真空涨落芯片约 0.7 cm³、10 Gbps 量级;它服务随机性与采样安全,不是 Xenomi 任务准确率的来源。SeedHijack 注入率与 QRNG 防御数字来自公开文献,不是本仓评测。
页面将路由、NER、关键词、短文本、摘要、科普与风险等任务分别呈现。Acc / F1 是对应任务指标,不能相加为总分,也不等同于通用智能能力。
端到端等待以 P50 毫秒表示,散点横轴使用 1000 / P50(ms),不是 tokens/s。不同型号的硬件与运行栈不同,绝对毫秒只用于各自对照,不代表同机横向结论。
模型家族包含 0.8B、4B、27B 与 122B-A10B;当前交付评测为 0.8B 与 4B,27B / 122B-A10B 仍是规格规划,不纳入散点与分数比较。
私有化部署可将量子随机数芯片接入熵池、KMS 与运行时采样器,配合健康检测、HRNG 降级、AI 稽核与安全网关形成可审计链路;这是部署方案说明,不构成已完成的全量生产验证。
Agent 决策三项来自 llama.cpp BF16(2026-08-18),与当场转出的 Qwen3.5-4B 基座同口径:风险决策 57.4→95.9,工具决策 92.5→95.4,结束决策 33.3→70.8。CUDA PEFT 历史口径为 93.7 / 96.4 / 83.3,页面不把两条运行栈写成同一组分数。
LoRA 需要与对应的 Qwen3.5 基座一起加载。许可为 Apache 2.0。Hugging Face 与 GitHub 地址通过环境变量注入,尚未配置时页面显示「即将开放」。