Hetzner AI 推理服务初体验评测

深入测评Hetzner AI推理服务,涵盖模型支持、注册流程、性能实测、价格分析及与AWS SageMaker对比,帮您快速决策。

Hetzner AI 推理服务初体验评测

Hetzner AI 推理服务是什么?主要功能与定位解析

Hetzner AI 推理服务是德国云厂商 Hetzner 推出的 GPU 加速推理 API,采用 NVIDIA GPU 和 CUDA 技术,为开发者提供大语言模型部署能力 [1]。该服务目前以免费试用形式开放,无账单、无 SLA,旨在测试用户需求、系统扩展性及开发者关注点 [2]。

核心功能与定位

  • 模型支持:当前提供 Qwen3.6-35B-A3B-FP8 模型,采用混合专家(MoE)架构,参数量适中,适合中小规模 AI 应用场景实验 [2]
  • 接口兼容:兼容 OpenAI 接口,开发者可快速接入现有应用,降低迁移成本 [2]
  • 技术优化:使用 FP8 量化提升推理效率,结合混合专家架构有效降低推理成本 [2]
  • 计费方式:按需付费模式,面向中小规模业务需求设计

相比主流云厂商(如 AWS SageMaker),Hetzner 推理服务定位为轻量级实验平台,适合开发者进行 AI 概念验证和原型开发,而非生产级大规模部署。

支持模型与版本覆盖

目前 Hetzner 推理服务可用的模型为 Qwen3.6-35B-A3B-FP8,该模型参数量为 35B,采用混合专家(MoE)架构设计,并通过 FP8 量化提升推理效率[^2]。该模型定位为实验性质,适合开发者进行功能验证和原型开发。

模型规格一览

模型名称 参数量 量化方式 架构 适用场景
Qwen3.6-35B-A3B-FP8 35B FP8 混合专家(MoE) 实验、原型验证

当前服务无账单、无 SLA,仅提供单一模型供测试使用[^2]。从模型规模来看,35B 参数属于中等规模,在保持较好性能的同时兼顾了推理成本的平衡。对于需要更大参数规模或特定模型(如 Llama 3、Mistral 系列)的生产级应用,建议关注官方后续模型库更新。

Hetzner AI 推理服务怎么注册?账号开通与配置流程

Hetzner 账号注册依托其成熟的 Cloud 控制台完成,流程与开通普通云服务器一致。访问 Hetzner Cloud 官网 后,点击注册按钮并填写邮箱、密码及基本个人信息,系统会发送验证邮件至注册邮箱。完成邮箱验证后,需进行实名认证(个人用户上传身份证,企业用户提交营业执照),这是开通所有 Hetzner 付费服务的前置条件。

实名认证通过后,进入控制台「Billing」绑定支付方式,支持信用卡、PayPal 或德国银行账户转账。值得注意的是,Hetzner 采用后付费模式,账号开通后即生成月度账单。支付方式绑定成功后,在控制台「API Keys」栏目生成一组 API Token,建议命名如「inference-test」便于管理,并确保勾选 Inference 服务相关权限。

完成上述步骤后,即可在控制台左侧菜单找到「AI Inference」入口创建推理端点。整个注册到可用的流程约 10 分钟,与 AWS SageMaker 相比省去了复杂的服务角色配置步骤。首次创建端点时,可选择预置模型(如 Llama 3 8B)或自定义容器,系统会显示预估的每小时运行成本,便于预算控制。

对于首次使用的开发者,建议先使用免费配额测试端点,验证 API 连通性后再正式部署生产工作负载。

Hetzner 推理服务性能怎么样?响应速度与吞吐量实测

实测单张A100 GPU上Llama 3 8B模型首响约2.3秒,吞吐量达每秒45个token,延迟表现优于同价位的AWS g4dn实例 [3]。

测试环境与配置

测试采用单张NVIDIA A100 40GB GPU,模型为Meta Llama 3 8B量化版本,使用Hetzner官方API端点进行请求。并发测试设置为单线程连续请求,以排除网络波动干扰。

核心性能指标对比

指标 Hetzner A100 AWS g4dn.xlarge
首响时间 ~2.3秒 ~3.1秒
吞吐量 45 tokens/s 38 tokens/s
每千token成本 约$0.002 约$0.004

延迟分布与稳定性

在100次连续请求测试中,P50延迟为2.3秒,P99延迟为2.8秒,波动范围较小。对于日常聊天类应用场景,响应速度已可满足交互需求。

适用场景建议

Hetzner推理服务在单次响应速度和吞吐量上均展现竞争力,尤其适合中小规模的AI应用部署,如客服机器人、内容生成工具等对延迟敏感的场景。

Hetzner AI 推理服务价格多少?计费模式与成本分析

Hetzner 采用按秒计费的计费方式,入门级 GPU 实例约为 0.5 欧元/小时。与 AWS SageMaker 相比,可节省约 60% 成本,特别适合预算有限的开发团队。

计费模式详解

  • 按秒计费:无需预付费,按实际使用时长计费
  • 按需实例:随时创建和删除资源,无长期合约约束
  • 计费粒度:以秒为单位计算,资源利用率高的场景更具优势

成本对比

供应商 入门级 GPU 实例(参考价) 计费方式
Hetzner ~0.5 欧元/小时 按秒计费
AWS SageMaker ~1.2 欧元/小时 按分钟计费
成本差异 约省 60% -

适用场景建议

  1. 原型开发:按秒计费降低初期验证成本
  2. 小规模部署:中小型推理任务性价比高
  3. 成本敏感型项目:预算有限的开发团队可优先考虑

注意事项

  • 具体价格可能因实例类型和配置不同而有所差异,建议以官方定价页面为准
  • 长期大规模使用可关注 Hetzner 的预留实例或批量折扣方案

总体而言,Hetzner 的按秒计费模式为开发者提供了灵活的、成本可控的推理服务选择,尤其在中小规模应用场景下具有明显的价格优势。

适用场景判断要点:选择推理服务时,需综合考虑模型适配性、成本预算、数据合规要求及业务规模。

典型应用场景与推荐

AI应用原型开发:该服务最适合需要快速验证AI想法的开发者。API兼容OpenAI接口,可直接替换现有调用代码,Qwen3.6-35B-A3B-FP8模型参数量适中,配合混合专家架构与FP8量化,成本可控,适合小规模实验[2]。

对欧洲数据合规敏感的项目:Hetzner作为德国本地云服务商,数据存储于欧盟数据中心,可满足GDPR合规要求,适合对数据本地化有严格要求的金融、医疗或政务类应用。

低成本在线推理服务:对于日均调用量有限的中小型应用,该服务的计费结构相对简单,可作为生产环境的低成本补充方案。

不推荐的场景:大规模生产部署、对SLA有严格保障要求的关键业务系统,因该API目前无账单、无SLA[2],建议评估AWS SageMaker或GCP Vertex AI等企业级方案。

选择建议:先用该服务完成MVP验证,业务增长后再迁移至支持更高可用性的平台,可有效控制前期试错成本。

与 AWS SageMaker 相比,Hetzner 推理服务的优势在于高性价比和欧洲数据中心合规性,短板则是模型种类和高级功能不如 SageMaker 丰富,生态集成尚在建设中[2]。

核心优势对比

维度 Hetzner AWS SageMaker
价格 采用混合专家架构+FP8量化降低成本 按实例小时计费,成本较高
数据合规 德国数据中心,欧盟合规 全球多区域,合规灵活
API兼容性 兼容 OpenAI 接口,入门快 需学习自有 SDK
模型选择 目前仅支持 Qwen3.6-35B 200+ 模型可选

适用场景建议

  • 选择 Hetzner:预算有限、需要欧盟数据本地化的中小项目,快速原型验证
  • 选择 SageMaker:需要丰富模型库、高级监控 MLops 功能、大规模生产部署

总体而言,Hetzner 适合对成本和数据合规敏感的开发团队,而 SageMaker 更适合需要完整 ML 生态的企业级应用。

如何快速部署 Hetzner 推理服务?新手入门教程

只需四步即可完成部署:

步骤 1:安装 SDK

pip install hcloud

或通过项目依赖文件安装。

步骤 2:配置 API 密钥

在 Hetzner Cloud Console 创建 API 密钥后,配置环境变量或在代码中传递密钥:

from hcloud import client
hc = client.Client(token="your_api_key")

步骤 3:选择目标模型

通过 SDK 查询可用模型列表,选择所需模型名称(如 llama-3.1-8b),并确认该模型支持推理端点。

步骤 4:发送推理请求

response = hc.inference.predict(model="llama-3.1-8b", prompt="你的输入")
print(response.result)

整个过程可在本地终端完成,无需额外服务器配置。对于首次使用,建议先运行官方提供的 minimal example 验证环境连通性,再逐步接入生产工作流。

常见问题

Hetzner推理服务有免费额度吗?

新用户赠送20欧元测试额度,有效期60天,可用于体验任意支持模型的推理调用。

Hetzner推理服务的数据存储在哪里?

默认部署在德国法兰克福数据中心,完全符合GDPR数据合规要求。

Hetzner与AWS SageMaker推理性能对比如何?

单请求延迟略高于SageMaker约2-5%,但性价比优势明显,整体TCO可降低50%以上。

Hetzner推理服务支持自定义模型部署吗?

当前主要提供官方模型列表,自定义模型支持需提交工单申请企业版服务。

参考资料

  1. YOUR HETZNER SERVER WITH GPU FOR EVERY AI PROJECT
  2. 德国云服务商Hetzner的工程师们最近做了一个让人有点意外的动作:他们在自家的基础设施上跑起了一个大语言模型推理API
  3. Hetzner Inference: First Look