欢迎光临
我们一直在努力

PolyLink基于区块链的用于LLM推理去中心化边缘AI平台

大家读完觉得有帮助记得关注和点赞!!!

摘要

近年来,大语言模型(LLMs)的快速发展彻底改变了AI领域的格局。然而,LLM服务的部署模式和使用仍然高度集中化,给最终用户和开发者带来了显著的信任问题和成本。为了解决这些问题,我们提出了PolyLink,一个基于区块链的去中心化AI平台,它将LLM的开发和推理去中心化。具体来说,PolyLink引入了一种去中心化的众包架构,支持在边缘的异构设备上进行单设备和跨设备的模型部署与推理。此外,为了确保推理的完整性,我们设计了TIQE协议,该协议结合了轻量级的交叉编码器(Cross-Encoder)模型和“LLM即法官”(LLM-as-a-Judge)的方法,以实现高精度的推理评估。最后,我们为所有参与者集成了一套基于代币的、包含动态定价和奖励机制的综合激励模型。我们已经部署了PolyLink,并通过在异构设备上进行地理分布式的部署进行了广泛的真实世界评估。结果表明,推理和验证延迟是切实可行的。我们的安全分析表明,该系统能够抵抗模型退化攻击和验证者腐败攻击。PolyLink现已可通过链接1访问。

1 引言

人工智能(AI)在各个领域经历了巨大的增长和普及。特别是,基于云的大型语言模型(LLMs),如ChatGPT、Claude和Gemini,已成为近年来的突破性AI服务,在通用任务的理解、生成和推理方面展现出卓越的能力,从而催生了广泛的AI应用。

然而,当前的AI服务和应用程序高度集中化,少数利益相关者(例如云服务提供商)控制着大部分基础设施、模型和访问权限。这种集中化源于几个实际因素:大模型的训练和推理都需要大量的计算和能源资源,这些资源通常集中在数据中心。普通的终端用户、中小型企业和组织通常无法承担这样的硬件和软件成本。因此,当前AI的中心化性质造成了获取和改进AI的显著障碍,特别是对于发展中地区或财力有限的个人和组织。

AI民主化是最近的新趋势,旨在通过将AI从集中化的利益相关者重新分配给去中心化的各方来解决AI集中化问题[1]。具体来说,AI民主化包含三个层面:1)​使用​:使最终用户更能负担得起AI服务和应用程序的价格;2)​开发​:为开发者推广具有成本效益的硬件基础设施(如GPU)和开源AI开发框架,以便自由开发和部署他们定制化的AI模型(例如,联邦学习[2]);3)​治理​:实现对AI模型和硬件基础设施的分布式所有权和透明化管理。

去中心化物理基础设施网络(DePIN)被认为是实现AI民主化的一种有前景的解决方案[3]。在DePIN协议中,参与者贡献其闲置的计算资源(例如GPU和CPU)到一个共享网络,这些资源被进一步集群化以支持AI模型训练和推理。基于区块链的激励(如代币)用于奖励贡献者,以治理网络,激励提供具有完整性的高质量AI服务。然而,现有的DePIN协议面临三个挑战。首先,低端设备提供的有限计算资源使得DePIN难以支持大规模LLM。其次,计算结果完整性的验证机制要么不安全,要么效率低下,容易受到试图进行不诚实计算以牟利的恶意设备所有者的攻击。第三,现有的DePIN激励机制通常效果较差,因为它们只应用类似传统的云服务价格模型(设备提供商和用户),忽略了为贡献AI模型的开发者提供奖励。

为了应对这些挑战,我们提出了PolyLink,一个运行在边缘网络之上的、基于区块链的去中心化AI平台。我们开发了一个支持单设备和跨设备执行的推理框架,能够在具有不同模型大小和计算需求的异构设备上灵活部署。然后,我们设计了一个无信任推理质量评估(TIQE)协议,确保在没有中央权威的情况下推理的完整性。最后,我们开发了一个综合的激励机制,根据设备贡献者和模型提供者的贡献和结果质量公平地奖励他们,同时向服务用户收取费用。我们在由多所大学贡献的20个地理分布式设备上进行了广泛的真实世界部署和评估。结果表明,该系统能够在异构边缘环境中提供稳健的推理,并具有可接受的延迟。TIQE协议在低延迟和高精度之间实现了良好的平衡。我们的安全分析进一步证明了其能够抵抗模型退化和验证者腐败攻击。本文的主要贡献如下:

  • 我们设计了PolyLink,这是第一个具有完整设计细节的基于区块链的去中心化AI平台,支持在异构边缘网络上进行单设备和跨设备的LLM推理。

  • 我们提出了TIQE协议,结合轻量级交叉编码器模型和“LLM即法官”的方法,以低成本确保推理完整性。

  • 我们开发了一个动态激励模型,包含奖励和定价机制,以协调模型提供者、工作者(Worker)和验证者(Validator)的利益。

  • 我们通过对多样化设备进行真实世界的大规模地理分布式部署来评估PolyLink,并提供安全分析,表明其能够抵抗模型退化和验证者腐败。

​图 1:​​ PolyLink概述,一个基于区块链的去中心化边缘AI平台。服务用户通过API发送推理请求。API服务器将针对同一模型的请求进行批处理,然后由运行该模型的工作者处理。响应被返回并由验证者评估推理质量。

2 相关工作

我们对现有的无信任推理协议和去中心化AI平台进行了全面回顾,总结了它们的关键贡献并分析了其局限性(表一)。

​无信任推理协议。无信任推理协议旨在保证在不可信设备上执行的LLM推理的完整性。zkLLM [4]通过为每个结果生成零知识证明,成功地提供了密码学上可验证的推理,并实现了完全去中心化。然而,该方法会产生大量开销。对于LLaMa-2-13B,生成模型承诺需要986秒,为每次推理生成证明需要803秒。SVIP [5]采用了一种基于激活的方法,在最终层激活和输入上训练分类器,但它依赖于可信第三方(TTP)进行训练且缺乏泛化性。TOPLOC [6]和SPEX [7]使用局部敏感哈希(LSH)来哈希激活值并验证推理完整性,但它们需要TTP重新进行推理,并且不能有效区分高精度模型执行。

​去中心化AI平台。最近,许多项目在Web3生态系统内追求去中心化AI。AIArena [8]针对去中心化训练:验证者使用公共数据集评估训练质量。io.net [9]提供去中心化计算资源,并依赖设备端状态监视器和工作日志来确保工作者诚实地执行任务。SMART [10]提供了一个混合链上/链下推理框架,但其对可信执行环境(TEEs)的依赖限制了平台的可扩展性和效率。

​表一:现有协议和平台总结​

类别

工作

服务

去中心化程度

完整性

效率

协议

zkLLM [4]

推理

基于密码学

 

SVIP [5]

推理

基于学习

 

TOPLOC [6]

推理

基于LSH

 

SPEX [7]

计算

基于LSH

平台

AIArena [8]

训练

基于评估

 

io.net [9]

计算

基于日志

 

SMART [10]

推理

基于TEE

 

​PolyLink​

​推理​

​●​

​基于评估​

​◐​

• † ● = 提供该属性;◐ = 部分提供;○ = 不提供。

3 PolyLink 概述

3.1 系统模型

图1显示了PolyLink系统的概览。PolyLink中有几种参与者:

  • ​服务用户 (Service User)​​:服务用户向系统发送推理请求,并使用加密货币代币支付计算费用。

  • ​工作者 (Worker)​​:拥有闲置GPU资源的参与者,包括NVIDIA GPU、NVIDIA Jetson、Apple Silicon等,贡献这些资源并赚取奖励。工作者分为两类:单设备工作者和多设备工作者。

  • ​模型提供者 (Model Provider)​​:模型提供者负责在工作者上部署他们自己的LLM(例如微调模型)并赚取奖励。

  • ​验证者 (Validator)​​:验证者负责评估工作者上模型响应的推理质量。要参与,验证者必须质押大量代币。

3.2 威胁模型

PolyLink是一个去中心化平台,大多数系统参与者是不可信任的,这可能引入以下威胁。

​模型退化攻击 (Model Degradation Attack)​。恶意工作者可能使用低精度模型或执行惰性计算以牟利,导致推理质量下降。

​验证者腐败攻击 (Validator Corruption Attack)​。恶意验证者可能故意提交被操纵的分数(过高或过低)以破坏共识过程,扭曲质量评估,并破坏奖励分配的公平性。

我们假设来自提供者的模型是良性的,底层区块链正确运行且保持可用,并且少于1/3的验证者是恶意的,遵循标准的拜占庭容错假设。

3.3 设计目标

为了应对DePIN中的挑战,PolyLink的设计目标如下。

​去中心化和无信任 (Decentralization and Trustless)​。系统在不依赖TTP的情况下协调参与者之间的计算和验证。验证者委员会和模型部署都遵循去中心化的边缘计算范式,使系统区别于OpenAI或Google等传统云平台。此外,我们优先考虑实际地理分布的设备。

​推理完整性 (Inference Integrity)​。推理请求在去中心化的工作者上被诚实地执行,其结果由验证者通过协议进行评估以保证完整性。

​激励和协议效率 (Incentive and Protocol Efficiency)​。系统设计旨在确保对每个实体公平和可持续的激励。此外,系统用于完整性的协议不会引入大量开销。

4 PolyLink 规范

4.1 去中心化模型推理

我们的平台通过将所有推理请求路由到工作者来实现去中心化模型推理。我们在工作者上提供两类推理:单设备推理和跨设备推理。

​单设备推理 (Single-device Inference)​。模型 M部署在单个设备上。通常,这种方法用于参数相对较少的模型。我们将推理过程定义为一个函数

其中服务用户将长度为 p的提示 tp​输入模型 M。模型输出一个长度为 r的答案 tr​。

​跨设备推理 (Cross-device Inference)​。对于拥有多个设备并旨在部署大参数模型的工作者,我们采用EdgeShard方案[11],该方案将模型 M划分为 n个顺序分片,在独立的设备上执行:

由于LLMs的自回归特性,推理在分片之间进行 r轮迭代执行。令 x0;0​:=tp​表示初始输入。在第 k轮 (k≥1),对于每个分片 Mi​,中间输出计算如下:

经过 r轮后,最终响应为:

4.2 定价与激励机制

4.2.1 定价机制

对于每个推理请求 Reqi​,成本 Cinferencei​由输入/输出令牌长度 p, r和模型的计算复杂度决定。定价公式定义为:

其中 SM​表示归一化的模型规模因子,δ是一个反映市场调整的缩放系数。Cini​和 Couti​是每个输入令牌和输出令牌的基础成本。

4.2.2 激励机制

在为选定模型在一个工作者上运行的每个推理批次中,我们假设每个推理任务的基础奖励表示为 Ri​=θ⋅Cinferencei​,θ是奖励参数。一个批次包含 b个推理任务,分配给该批次的总奖励为 Rbatch​=∑i=1b​Ri​。奖励分为两部分:固定部分 β⋅Rbatch​分配给验证者,动态部分 (1−β)⋅Rbatch​根据模型质量分数 α∈[0,1]进行分配(算法1)。

​工作者奖励 (Worker Reward)​。工作者根据其模型分数获得动态奖励的一部分:

​验证者奖励 (Validator Reward)​。假设批次中有 m个验证者。每个验证者 vi​质押了一定数量的代币 STvi​​。定义质押代币的向量为:

总验证者奖励包括固定的基础部分和动态部分的剩余:

每个验证者 vi​获得与其质押金额成比例的验证者奖励份额:

​算法 1 推理批次的奖励分配​

​输入:​​ R: 每个推理任务的奖励向量

b: 批次中的推理任务数

α: 模型质量分数

β: 验证者基础奖励因子

ST: 验证者质押额

​输出:​​ Rworker​: 工作者的奖励

{Rv1​​,…,Rvm​​}: 验证者的奖励

1 ​Procedure​ RewardDistributed (R,b,α,β,ST):

2   Rbatch​:=0

3   ​foreach​ Ri​∈R​do​

4     Rbatch​:=Rbatch​+Ri​

5   ​end foreach​

6

7   Rworker​:=α⋅(1−β)⋅Rbatch​

8   Rvalidators​:=[β+(1−α)⋅(1−β)]⋅Rbatch​

9   ​for​ j←1​to​ m​do​

10     STtotal​:=STtotal​+STvj​​

11   ​end for​

12   ​for​ i←1​to​ m​do​

13     Rvi​​:=STtotal​STvi​​​⋅Rvalidators​

14   ​end for​

15

16 ​End​

​return​ Rworker​,{Rv1​​,…,Rvm​​}

​模型提供者奖励 (Model Provider Reward)​。模型提供者通过与工作者交易获得奖励。具体来说,当工作者选择并使用模型提供者提供的模型时,它必须支付由模型提供者定义的模型使用费(MUF)。该费用可以是固定的,也可以根据模型质量动态定价。工作者本身也可以充当模型提供者。

4.3 无信任推理质量评估协议 (TIQE)

为确保推理完整性和质量,我们提出了一个无信任推理质量评估(TIQE)协议(图2),该协议使去中心化的验证者委员会能够执行质量评估并就结果达成共识。基于此共识,为运行在工作者的模型分配一个模型质量分数。

​图 2:​​ 每个 epoch(周期)中 TIQE 协议的概述

4.3.1 质量评估过程

在此过程中,验证者使用无信任评分机制评估推理结果。评估函数形式化定义为:

其中 J表示用于评估结果的判断方法。我们提出三种判断方法来支持高效、成本效益高的推理质量评估。

​交叉编码器方法 (Cross-encoder Approach)​。交叉编码器是一种轻量级的基于Transformer的模型(例如BERT、参数较少的LLM),经过训练用于衡量相关查询-文档对之间的相似性[12, 13]。我们通过连接提示和相应的输出结果构建一个输入对,然后将其输入交叉编码器模型以产生质量分数。这种交叉编码器提供了一种轻量级的评估解决方案,用于估计提示和结果之间的语义相似性。然而,由于其模型能力的限制,它在开放生成场景中受限。

​LLM即法官方法 (LLM-as-a-Judge Approach)​。凭借显著的泛化和推理能力,LLM被广泛用于评估其他LLM的性能[14]。通常,法官LLM必须是一个具有强大推理能力的大规模模型,例如ChatGPT-o3 (175B)、Gemini 2.5 Pro、DeepSeek-V2 (671B) 或 LLaMA 3.2 (405B)。图3说明了法官LLM使用的评估提示示例,用于评估输出质量并产生相应的模型分数。

You are an expert judge. Your task is to rate the quality of the following LLM inference result given the provided input. Rate on a scale from 1 to 5, where:
1 = Completely incorrect or nonsensical
2 = Mostly incorrect or with major flaws
3 = Partially correct but with noticeable issues
4 = Mostly correct with minor issues
5 = Completely correct, comprehensive, and well-reasoned
Input:
{input}
LLM Inference Output:
{output}
Please return only the numeric score (1 to 5) and no explanation.
Score:

​图 3:​​ LLM即法官用于评估去中心化LLM推理质量的提示词。

LLM即法官方法可以通过调用商业API或是在验证者节点上部署法官模型来实现。然而,调用商业API,例如OpenAI的GPT-o3(输出每百万令牌收费高达40.0美元¹),会引入显著成本。或者,本地部署法官模型对验证者施加了 substantial 的硬件要求,包括高内存容量和GPU资源。

​混合方法 (Hybrid Approach)​。为了减轻交叉编码器和LLM即法官两种方法的局限性,我们提出了一种混合评估方法。在每个周期(epoch)内,当验证者收集到与工作者上特定模型相关联的一批推理任务时,他们使用交叉编码器评估该批次。在周期 e中,交叉编码器分数 Scorecrosse​定义为:

在周期内随机选择的一个时间点,使用LLM即法官方法进行一次评估评分,该评分在最终评分计算中被赋予更高的权重。在周期 e中,LLM分数 Scorellme​定义为:

这种混合方法使系统能够在保持评估准确性的同时显著降低计算成本,从而为无信任模型质量评估提供更具成本效益和可扩展的解决方案。在特定周期 e之后,最终模型质量分数定义为:

4.3.2 模型质量分数共识

在TIQE协议中,验证者在每个周期开始时被选举出来,他们负责就模型质量分数达成共识。在本节中,我们介绍这两个关键过程的设计:验证者选举和共识形成。

​验证者委员会选举 (Validator Committee Election)​。在每个周期开始时,使用基于可验证随机函数(VRF)的选择机制选举一个验证者委员会。当验证者 Vk​∈V观察到新周期 e开始时,它使用其私钥 skk​和一个由前一个区块哈希 Hprev​和周期哈希 H(e)组成的随机种子执行VRF。

其中 rk​是一个可验证的伪随机数,πk​是一个证明,证明 rk​是使用 skk​正确计算的。我们的系统定义了一个公共选举规则 R(rk​):

其中 ∣V∣是合格验证者的总数,Mcommittee​是期望的委员会,∣Mcommittee​∣是委员会规模。如果 rk​满足该规则,则该验证者成为周期 e的验证者委员会 Mcommittee(e)​的成员。证明 πk​可以被任何其他节点用来验证 Vk​是公平当选的,而无需透露其私钥 skk​。这种机制确保了每个周期中验证者的去中心化、不可预测和可验证的选举。

​验证者委员会共识 (Validator Committee Consensus)​。在每个周期的共识阶段,当选委员会中的所有验证者将其个人模型质量分数提交到智能合约 SC。在 SC收集到足够的分数 Score后,SC从 Score计算中位数分数 Scoremed​。

为了阻止不诚实或有偏见的评估,我们定义了一个偏差阈值 Th。如果一个验证者的分数 Scorei​∈Score与中位数分数的偏差超过 Th,即:

则该验证者将通过罚没(Slashing)一部分质押代币受到惩罚。智能合约如算法2所示。

​算法 2 评分共识智能合约​

​输入:​​ Score: 验证者提交的分数

ST: 验证者的质押代币

Th: 偏差阈值

​输出:​​ Scoremed​: 最终共识模型分数

Slashed: 受罚验证者的罚没向量

1 ​Procedure​ ConsensusOnScore (Score,ST,Th):

2   将 Score按升序排序

Scoremed​:=Median(Score)

Slashed:={0,…,0}

​foreach​ i←1​to​ m​do​

3     ​if​ ∣Scorei​−Scoremed​∣>Th​then​

4       Slashed[i]←γ⋅STvi​​       // γ是罚没率

5

6     ​end if​

7

8   ​end foreach​

9

10 ​End​

​return​ Scoremed​,Slashed


​5 安全分析​

在本节中,我们在威胁模型下分析 PolyLink 的安全性。

​定理 1 (模型退化攻击抵抗)​​

如果一个工作者持续执行低精度推理,则其在指定周期 e中获得的奖励将为 0。

​证明 1​

工作者在周期 e中的奖励是 R_worker = α^e (1-β) * R_batch,其中 α^e ∈ [0, 1]。假设该工作者在前 e-1个周期中持续执行低精度推理。那么,根据评估函数(公式 11),最终质量分数满足 α^e = λ * Score_LLM^e + (1-λ) * Score_Cross^e ≈ 0。因此,R_worker ~ 0 * (1-β) * R_batch = 0。所以,持续进行低质量推理的工作者将获得零奖励。

​定理 2 (验证者腐败攻击抵抗)​​

如果一个验证者持续进行不诚实行为(< 1/3),则其在指定周期 e中质押的代币将被罚没至 0。

​证明 2​

设 Score_i是验证者 v_i在周期 e中提交的分数,Score_med是委员会的中位数分数。智能合约强制执行罚没,如果偏差超过阈值 Th:|Score_i – Score_med| > Th ⇒ Slash[i] = γ * ST_v_i, γ ∈ (0, 1]。我们考虑三种典型的不诚实行为:

  • ​过高评分 (Over-scoring)​。验证者对低质量输出给予人为的高分。由于假设大多数验证者是诚实的(< 1/3是恶意的),诚实分数将 Score_med锚定在更接近真实值的位置。因此,来自 v_i的虚高分数将超过阈值并触发罚没。

  • ​过低评分 (Under-scoring)​。验证者给予异常低的分数以降低诚实工作者的分数。同样,与 Score_med(接近诚实平均值)的偏差将导致 |Score_i – Score_med| ≫ Th ⇒ Slashed。

  • ​随机评分 (Random-scoring)​。验证者提交不一致或不相关的分数以破坏共识。统计上,此类行为将周期性地偏离超过 Th,并在多个周期内累积罚没。

在每种情况下,验证者的质押代币每个不诚实周期都会以 γ的速率被罚没。经过 k个不诚实周期后,剩余的质押为:ST_v_i(k) = ST_v_i(0) * (1-γ)^k。取 k → ∞时的极限:lim_{k→∞} ST_v_i(k) = 0。因此,任何持续提交不诚实分数的验证者最终将失去所有质押代币。


​7 实施与评估​

​7.1 实施​

我们实现了提出的 PolyLink 系统,集成了所有先前描述的组件。系统后端和前端部署在一个具有 4 核 CPU 和 8G 内存的云服务器实例上。我们在 Sepolia 测试网² 上部署了智能合约并发行了 ERC-20 代币。

​7.2 真实世界评估​

​7.2.1 地理分布式部署​

我们在多个地区(包括中国香港特别行政区、中国广州和深圳以及日本金泽)的 10 个不同工作者中部署了 20 台设备,进行了大规模地理分布式部署。

这些工作者在去中心化的边缘网络配置中运行,每个工作者独立运行并参与无信任推理任务。已部署工作者节点的详细硬件规格如表 II 所示。

​表 II:地理分布式边缘工作者的硬件规格​

工作者

位置

设备类型

数量

1

广州番禺

NVIDIA RTX 2080 Ti

2

2

金泽角间町

NVIDIA RTX A4500

1

3

香港红磡

NVIDIA RTX 4060 Ti x1, RTX 3080 Ti x1, Jetson Orin NX 16GB x3, Jetson AGX Orin 32GB x3

8

 

深圳罗湖

Apple MacBook Pro (M3 Pro)

1

4

香港薄扶林

NVIDIA Tesla P100

2

5

香港西贡

NVIDIA RTX 4090

8

6

香港红磡

NVIDIA RTX 3090

3

7

香港沙田

NVIDIA RTX 3090

4

8

香港沙田

NVIDIA RTX 3060

1

9

香港红磡

NVIDIA RTX 2060 x1, RTX 3090 x5, RTX 3090 Ti x1

7

10

香港红磡

NVIDIA Quadro GV100 x2, Tesla A100 x1, RTX 4090 x4

7

​7.2.2 评估指标​

我们从三个主要方面进行评估:地理分布式去中心化推理性能、TIQE 协议性能和奖励分配。

​地理分布式去中心化推理性能。​​ 我们考虑几个指标:​平均延迟 (Average Latency)​​ 和首令牌时间 (Time to First Token, TTFT)​​ 用于衡量用户体验,​输出令牌吞吐量 (Output Token Throughput, OTPS)​​ 和请求吞吐量 (Request Throughput, RTPS)​​ 用于评估系统性能,以及失败率 (Failure Rate, FR)​​ 用于反映系统稳定性。

​TIQE 协议性能。​​ 我们使用两个指标评估 TIQE 协议:

  • ​性能开销 (Performance Overhead)​​:指质量评估过程引入的计算和财务成本。具体来说,我们测量 Cross-Encoder 和 LLM-as-a-Judge 组件的延迟,以及调用 LLM-as-a-Judge 的相关成本。

  • ​退化检测准确率 (Degradation Detection Accuracy)​​:评估 TIQE 识别退化输出的有效性。我们报告 Cross-Encoder 和 LLM-as-a-Judge 的真阳性率 (True Positive, TP)​​ 和假阳性率 (False Positive, FP)​。

​任务奖励分配。​​ 我们考虑不同条件下的奖励分配以评估:

  • ​激励有效性 (Incentive Effectiveness)​​:高质量执行者是否获得适当的奖励。

  • ​惩罚合理性 (Penalty Rationality)​​:低质量或不诚实行为是否受到适当惩罚。

  • ​分配公平性 (Fairness of Distribution)​​:验证者是否获得与其质押份额成比例的公平奖励。

​7.3 实验设置​

​7.3.1 地理分布式去中心化推理性能​

我们在工作者上部署了不同参数的 LLM:DeepSeek-R1-1.5B、DeepSeek-R1-7B 和 DeepSeek-R1-14B。模型使用单设备和跨设备设置执行。从 H3 数据集 [15] 中采样总共 1000 个查询,并从位于香港的客户端发送。

​7.3.2 TIQE 协议性能​

我们采用 Cross-Encoder 模型 TinyLM-L6-v2³ 和通过 DeepSeek API⁴ 实现的 LLM-as-a-Judge(输入令牌 0.07 美元/百万,输出令牌 1.10 美元/百万)。对于退化检测,我们从 ShareGPT-Chinese-English-90k 数据集 [16](包含用户与 ChatGPT-4o 之间的真实对话)中采样了 50 个真实和 50 个虚假响应示例。

​7.3.3 任务奖励分配​

为了评估提出的奖励机制,我们分析了不同条件下的奖励分配,参数总结在表 III 中。

​表 III:奖励分配的评估参数设置​

参数

描述

β

分配给验证者的奖励部分

0.3

θ

任务奖励的缩放因子

1.0

b

每批任务数

32

R_i

每任务成本

[0.1, 0.5]

α

代表结果质量的分数

{0.2, 0.5, 0.8, 1.0}

ST

验证者质押向量

案例 1: [100,100,100]
案例 2: [100,300,600]

​7.4 结果与分析​

​7.4.1 地理分布式去中心化推理性能​

表 IV 总结了推理性能。模型大小显著影响延迟和吞吐量:参数较少的模型(例如 1.5B)产生较低的延迟和较高的吞吐量,而大参数模型(例如 7B, 14B)会产生大量开销。地理距离也会影响性能,香港的工作者始终获得更好的结果。例如,运行 1.5B 模型的 RTX 4060 Ti 实现了平均延迟 10.82 s,TTFT 1.02 s和吞吐量 120.40 tok/s;相比之下,深圳的相同模型表现较差。跨设备推理支持执行大参数模型(例如 14B),但引入了额外的开销,观察到的最高延迟为 160.05 s。在所有配置中,失败率均低于 5%,并且延迟对于个人使用是可接受的。这些结果证实了 PolyLink 在异构、地理分布的环境中支持可靠、响应迅速的推理。

​表 IV:PolyLink 中的地理分布式去中心化推理性能​

设备位置

设备类型

模型

延迟 (s)

TTFT (s)

OTPS (tok/s)

RTPS (req/s)

FR

香港

RTX4060 Ti

Deepseek-R1-1.5B

10.82

1.02

120.40

0.092

0%

香港

RTX3080 Ti

Deepseek-R1-7B

12.13

1.20

87.30

0.082

0%

香港

RTX4090

Deepseek-R1-14B

17.28

1.37

55.73

0.058

0%

深圳

Apple M3Pro

Deepseek-R1-1.5B

23.30

5.65

49.46

0.041

2%

深圳

Apple M3Pro

Deepseek-R1-7B

52.84

17.59

18.02

0.018

5%

香港

RTX3080 Ti & RTX4060 Ti

Deepseek-R1-14B

160.05

8.84

7.12

0.006

2%

†​延迟​:从发送请求到接收完整响应所需的总时间。​TTFT​:从请求发起接收到第一个令牌的时间。​OTPS​:模型每秒生成的输出令牌数。​RTPS​:每秒处理的完整请求数。​FR​:未成功完成的推理请求的百分比。

​​图4:不同批次大小下 Cross-Encoder 的平均每批评估延迟。

a

b

​​图5:(a)延迟 (b)成本 – 不同批次大小下 LLM-as-a-Judge 的每批延迟和成本。

​​图6:用于检测模型退化攻击的交叉编码器和 LLM-as-a-Judge 的混淆矩阵。

​7.4.2 TIQE 协议性能​

如图 4 所示,Cross-Encoder 的平均每批评估延迟随着批次大小的增加而增加,从批次大小 1 时的约 10 ms 到批次大小 128 时的超过 250 ms。这表明 Cross-Encoder 是轻量级的,并且在中等批次大小下能够有效扩展。由于该模型是轻量级的,我们在分析中省略了其成本。

图 5 显示了调用 LLM-as-a-Judge 的延迟和成本。尽管每个批次内有并发请求,但由于排队,延迟随着批次大小的增加而增加,成本也相应上升。这揭示了批处理效率和响应时间之间的权衡。

图 6 展示了 Cross-Encoder 和 LLM-as-a-Judge 在退化检测任务上的混淆矩阵。Cross-Encoder 实现了 66% (33/50) 的 TP 率和 2% (1/50) 的 FP 率,表明具有中等检测能力且误报极少。相比之下,LLM-as-a-Judge 显著将 TP 率提高到 98% (49/50),但 FP 率稍高,为 12% (6/50)。

这些结果表明,Cross-Encoder 提供低延迟、成本效益高的评估,且具有可接受的准确性,而 LLM-as-a-Judge 则以增加的延迟和成本提供更高的检测准确性。

​7.4.3 任务奖励分配​

图 7 显示了奖励分配结果。随着模型质量分数的提高,工作者的奖励持续增加,反映了更高质量推理带来的更高回报。在不平等质押设置中(图 7(b)),质押较高的验证者(验证者 3)在验证者中获得最大份额,表明奖励是按质押比例分配的。这些结果验证了所提出的机制基于贡献质量和经济质押,公平有效地分配奖励。

a

b

​​图7:(a)平等质押设置。(b)不平等质押设置。 – 不同质押设置下批次的奖励分配。

VII 结论与未来工作​

我们提出了PolyLink,一个基于区块链的去中心化AI平台,支持在边缘网络上进行去中心化的大语言模型(LLM)推理。为了以低成本确保推理的完整性,我们引入了无信任推理质量评估(TIQE)协议。此外,我们的激励模型促进了网络参与者之间公平有效的奖励分配。真实世界的部署和评估表明,PolyLink是Web3和DePIN生态系统中去中心化AI的一个实用且可扩展的解决方案。

然而,该平台仍存在一些局限性。首先,关于攻击者控制少于三分之一验证者的安全假设在实际环境中可能不成立。其次,跨设备推理方法受到网络通信延迟的影响,因此可用的设备数量受到限制。

在未来,我们将探索解决这些局限性的方法,并通过引入跨链支持[17]和模型训练[18][1]来扩展PolyLink的网络规模。此外,我们计划基于PolyLink部署智慧城市应用,包括数字孪生和元宇宙。

 

 

赞(0)
未经允许不得转载:171主机测评 » PolyLink基于区块链的用于LLM推理去中心化边缘AI平台
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址