2026-06-10
分类:服务器技术
阅读(40) 评论(0)
文章主要内容与创新点总结
一、主要内容
研究背景:大语言模型(LLMs)在通用代码生成任务中表现优异,但在量子代码生成这一特殊领域的能力尚未得到充分研究。量子编程在语法和语义上与经典编程存在显著差异,现有基准(如Qiskit HumanEval)仅关注API合规性,缺乏对算法推理和量子语义正确性的系统性评估。
基准构建(QuanBench):基于Qiskit 0.46.0框架构建了包含44个量子编程任务的基准,涵盖量子算法实现(如Grover算法、量子傅里叶变换)、量子态制备(如Bell态、GHZ态)、门分解和量子机器学习四大类。每个任务均配有可执行的标准解决方案、自然语言描述和单元测试,后续计划扩展至117个任务并支持多框架适配。
评估方法:采用双指标评估体系——功能正确性(Pass@K,衡量生成代码通过测试的概率)和量子语义等价性(Process Fidelity,通过酉矩阵迹计算生成电路与标准方案的相似度),对9个主流LLM(含通用模型如GPT-4.1、Claude 3.7和代码专用模型如CodeLlama)进行测试。
实验结果:
- 现有LLM的量子代码生成能力有限,Pass@1准确率均低于40%,最高Pass@5仅50%(DeepSeek R1和Gemini 2.5);
- 模型性能与规模无严格相关性,领域适配比模型大小更重要;
- 常见错误包括过时API使用、电路结构错误、门操作滥用和算