数码基础设施

AI模型和GPU

立即在托管前沿模型上运行代理,或租用 GPU 容量、部署您自己的权重,并将 Digio 任务路由到同一工作区中的专用端点。

克劳德,GPT,双子座 每个代理模型选择 GPU 租赁和 BYOM
托管模型

Digio 现已提供型号

为每个代理分配默认模型或为每个任务覆盖。使用量以您的计划余额中的 Digio 代币计量——无论代理呼叫 Sonnet、GPT-4o 还是 Gemini Flash,都是同一个钱包。

人性化的克劳德

  • Claude Opus 4.7 旗舰推理、长背景、架构和策略工作。
  • Claude Opus 4.6 上一代 Opus 可实现稳定、高质量的分析。
  • Claude Sonnet 4.6 日常驱动程序——编码、编写和多步骤代理循环。
  • Claude Sonnet 4.5 / 4 快速 Sonnet 层,可对支持的工作负载进行即时缓存。
  • Claude Haiku 4.5 低延迟草稿、分类和大容量子任务。

开放人工智能

  • GPT-5.5 / GPT-5.4 / GPT-5.2 适用于一般和代理工作负载的最新 GPT-5 系列。
  • GPT-4.1 & GPT-4o 为生产代理提供可靠的多模式聊天和工具使用。
  • GPT-4o mini 用于摘要和轻量级步骤的经济高效的路由。
  • o3 / o3-pro / o3-mini / o4-mini 用于数学、规划和验证的推理模型。
  • GPT-5.3 Codex & Codex mini 代码生成、重构和存储库感知代理技能。

谷歌双子座

  • Gemini 2.5 Pro 长上下文研究和结构化提取。
  • Gemini 2.5 Flash 高吞吐量代理步骤具有具有竞争力的令牌率。
  • Gemini 2.0 Flash 用于解析、标记和批处理作业的超快速传递。

开放且专业的 API

  • DeepSeek Chat & Reasoner 对于聊天和思维链式任务具有很强的价值。
  • Mistral Large 欧洲托管的多语言代理团队选项。
  • Llama 3.3 70B 通过 API 的开放权重类模型 — 与私有 GPU 完美搭配。
  • Grok 3 新闻和社会监控代理的实时模型。
  • Sonar Pro 研究人员的基于搜索的答案。
  • Command R+ RAG 友好的企业聊天和检索工作流程。

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

用法

代理商如何选择模型

协调员可以根据任务类型推荐 Sonnet、Opus 和更便宜的闪存模型。高级用户为每个代理角色设置默认值 - Sonnet 的研究、Opus 的最终审查、Haiku 或 Gemini Flash 的批量标记。

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

GPU租赁

租用 GPU 并运行您自己的模型

需要微调、气隙检查点或可预测的推理定价?向您的 Digio 工作区添加专用 GPU 容量,安装您喜欢的服务堆栈,并在您的专用端点处指定代理。

专用实例

按小时或按月计算的 GPU 节点(A100、H100、L40S 级)连接到您的租户 — 与其他客户隔离。

你的体重

上传安全张量、GGUF,或从您的注册表中提取;运行 Llama、Mistral、Qwen 和自定义微调。

标准服务

vLLM、TGI、Ollama 或您维护的容器映像 - Digio 代理调用与 OpenAI 兼容的基本 URL。

相同的编排

要做的事情、团队聊天、技能和协作不变——只有推理后端是你的。

混合路由

将敏感步骤发送到专用 GPU,并在一个工作流程中使用 Claude 或 GPT 进行公共研究。

企业控制

受监管团队的 VPC 对等、静态出口、审核日志和模型许可名单。

带上你自己的模型

安装并连接自定义模型

从零到代理呼叫您的端点的典型设置:

  1. 预留GPU

    选择 VRAM、区域和正常运行时间(突发与始终开启)。重量存储随实例一起提供或安装在您的存储桶上。

  2. 部署堆栈

    启动服务映像或 SSH,安装 CUDA 驱动程序并加载检查点。健康检查确认模型已准备就绪。

  3. 注册端点

    在工作区设置中添加基本 URL、API 密钥和模型 ID。 Digio 在上线前会验证延迟和令牌格式。

  4. 分配给代理

    选择您的私人模特作为所选代理商的默认模特;托管的 Claude/GPT 模型仍然可以并排使用。

GPU 租赁费用与 Digio 计划订阅分开计费。请联系我们了解容量规划、SLA 以及从现有推理集群的迁移。

常问问题

模型和 GPU 问题

选择托管 API 与 Digio 上的自托管推理。

我是否需要支付两次费用——计划加 API?

您的 Digio 订阅涵盖基础设施、代理和包含的 Digio 代币。托管模型使用量按实际输入/输出令牌借记令牌余额。 GPU 租赁是您控制的机器的附加组件。

不同的代理可以使用不同的模型吗?

是的,每个代理都可以有自己的默认值。任务和聊天可以覆盖单次运行,而不更改全局默认值。

十四行诗和作品有什么区别?

Opus 已针对更难的推理和更长的连贯计划进行了调整;对于日常代理循环来说,Sonnet 更快、更便宜。 Haiku 和 flash 级模型最适合批量子任务。

我可以只运行我自己的模型和块云 API 吗?

企业工作区可以限制出站模型提供程序并将所有代理流量路由到您的 GPU 端点。混合模式是大多数团队的默认模式。

有哪些 GPU 尺寸可用?

产品取决于地区和需求,通常为 7B-70B 级型号提供 24-80 GB VRAM 层,为更大的堆栈提供多 GPU 节点。我们根据参数计数和量化来帮助您确定 VRAM 的大小。

私人 GPU 使用仍然消耗 Digio 代币吗?

编排(代理、任务、存储)保留在您的计划中。 GPU 上的推理按 GPU 时间计费;您可以选择计量令牌形式的使用情况以进行内部退款。

选择托管型号或自带 GPU

从今天开始使用 Claude 和 GPT,然后在准备好托管自定义权重时添加专用 GPU — 相同的代理、相同的任务和您的推理。