Início Serviços Arquitetura Vantagens Cenários Sobre Voltar ao site principal Centro de Membros
Cluster GPU online
Modelos prontos
Disponibilidade API 99.99%

200+ Modelos, Computação Massiva, Uma API para Tudo

DeepSeek·GLM·Qwen·Kimi·Llama totalmente integrados, plataforma de computação AI de nível empresarial

Lista de modelos

Todos os modelos disponíveis num relance

101+ modelos pré-integrados, modelos principais listados abaixo, atualizados continuamente

Modelo Parâmetros Comprimento de contexto Precisão Preço de entrada (ref.) Preço de saída (ref.) Status
GPT-4.1 mini OpenAI1M¥2.80 /百万Token¥11.20 /百万TokenOnline
GPT-4.1 Popular1M¥14.00 /百万Token¥56.00 /百万TokenOnline
o3 Raciocínio200K¥14.00 /百万Token¥56.00 /百万TokenOnline
Claude Sonnet 4.5 Anthropic200K¥21.00 /百万Token¥105.00 /百万TokenOnline
Claude Haiku 3.5 Anthropic200K¥5.60 /百万Token¥28.00 /百万TokenOnline
Gemini 2.5 Pro Google1M¥8.75 /百万Token¥70.00 /百万TokenOnline
Gemini 2.5 Flash Google1M¥1.05 /百万Token¥4.20 /百万TokenOnline
DeepSeek-V4 Pro Mais recente685B MoE128KBF16¥12.00 /百万Token¥24.00 /百万TokenOnline
DeepSeek-V4 Flash Mais recente685B MoE128KBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
DeepSeek-R1 Raciocínio685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万TokenOnline
GLM-5 智谱200B+128KBF16¥1.00 /百万Token¥6.00 /百万TokenOnline
GLM-5V-Turbo 多模态130B+128KBF16¥1.50 /百万Token¥3.00 /百万TokenOnline
Qwen3.7 Max Mais recente397B MoE128KBF16¥2.00 /百万Token¥6.00 /百万TokenOnline
Qwen3.6 Flash Rápido235B MoE128KBF16¥0.30 /百万Token¥0.60 /百万TokenOnline
Qwen3-Coder-Next Código235B MoE128KBF16¥1.50 /百万Token¥3.50 /百万TokenOnline
Kimi-K2.5 Mais recente1T MoE256KBF16¥2.50 /百万Token¥5.00 /百万TokenOnline
Kimi-K2 Thinking Raciocínio1T MoE256KBF16¥3.00 /百万Token¥6.00 /百万TokenOnline
MiniMax-M2.5 Mais recente456B MoE1MBF16¥2.00 /百万Token¥4.00 /百万TokenOnline
MiniMax-M2.5 Highspeed Rápido456B MoE1MBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
Doubao Seed 2.0 Pro 豆包128KBF16¥1.50 /百万Token¥3.00 /百万TokenOnline
Doubao Seed 2.0 Code Preview Código128KBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
Llama-4 Meta400B MoE1MBF16¥2.50 /百万Token¥5.00 /百万TokenOnline
Yi-Lightning 零一万物64KBF16¥0.50 /百万Token¥1.50 /百万TokenOnline
Step-2 阶跃星辰128KBF16¥1.50 /百万Token¥3.20 /百万TokenOnline
Hy3 Preview 混元128KBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
BAAI/bge-m3 Embedding568M8KFP16¥0.02 /百万TokenOnline
Casos de uso

Um comando, implante sua IA

Explore as soluções de implantação de infraestrutura AI da KHB em todas as indústrias, ao estilo desenvolvedor

enterprise-ai.sh
$ khb deploy --scenario=enterprise --model=DeepSeek-V3.2
算力资源分配完成
模型加载完成 DeepSeek-V3.2
API网关配置完成
企业AI平台已就绪
ENDPOINT: https://api.khb.com/v1/enterprise
STATUS: RUNNING
compute-center.sh
$ khb deploy --scenario=compute --chip=ascend,nvidia
异构算力统一纳管启动
NVIDIA A100 × 128 已接入
昇腾910B × 64 已接入
弹性调度引擎就绪
UTILIZATION: 94.7%
finance.sh
$ khb deploy --scenario=finance --security=private
Implantação privada环境初始化
数据隔离策略已启用
全链路加密传输已开启
Registros de auditoria系统就绪
COMPLIANCE: PASSED
manufacturing.sh
$ khb deploy --scenario=manufacturing --instance=reserved
预留实例资源锁定
工业AI模型部署完成
7×24 SLA保障已启用
质检模型推理延迟 <50ms
UPTIME: 99.99%
Instâncias reservadas

Assegure a computação, proteja negócios críticos

Computação reservada dedicada · Precisão do modelo garantida · Custos controláveis · SLA empresarial

DeepSeek-V3.2
deepseek-ai/DeepSeek-V3.2
Preço ¥594,000/组/月
Preço unitário efetivo ¥2.20/M tokens
TPM 1,250万
TTFT 1,600ms
TPS 45
Contexto 1M
Adequado para raciocínio complexo e análise de decisões de nível empresarial, geração de código e assistência de desenvolvimento de software, chamadas de ferramentas de agentes
GLM-5
zai-org/GLM-5
Preço ¥594,000/组/月
Preço unitário efetivo ¥2.75/M tokens
TPM 1,000万
TTFT 1,500ms
TPS 30
Contexto 1M
Adequado para desenvolvimento de agentes de nível empresarial, planejamento de tarefas complexas e execução multi-etapas, automação de engenharia de software
Kimi-K2.5
moonshotai/Kimi-K2.5
Preço ¥594,000/组/月
Preço unitário efetivo ¥6.88/M tokens
TPM 400万
TTFT 1,500ms
TPS 30
Contexto 256K
Adequado para desenvolvimento de agentes multimodais de nível empresarial, compreensão e análise de conteúdo visual, automação de tarefas complexas
MiniMax-M2.5
MiniMaxAI/MiniMax-M2.5
Preço ¥297,000/组/月
Preço unitário efetivo ¥2.75/M tokens
TPM 500万
TTFT 500ms
TPS 30
Contexto 1M
Adequado para análise de documentos longos e bases de conhecimento de nível empresarial, serviço ao cliente inteligente e geração de conteúdo, automação de processos de negócios
* Preço unitário efetivo baseado no TPM, calculado com 30 dias/mês e 50% de utilização global. Dados de desempenho baseados em parâmetros de inferência típicos: 24K Token de entrada, 1K Token de saída, taxa de acerto de cache de 80%. (Atualizado em 20 de maio de 2026)
Gateway AI

Gateway de serviço LLM privado

Gestão unificada · Roteamento inteligente · Limitação de taxa · Observabilidade de cadeia completa

01 Acesso multi-modelo unificado
Acesso one-stop e chamada padronizada de modelos de diferentes fornecedores, suportando interfaces compatíveis com OpenAI, eliminando gestão pontual, gerenciando facilmente ecossistemas multi-fornecedor
02 Roteamento inteligente e balanceamento de carga
Roteamento dinâmico inteligente combinando características de tráfego e características de serviço LLM, balanceamento de carga, failover Fallback, garantindo estabilidade do serviço e SLA de negócios
03 Governança granular e limitação de taxa
Configuração de permissões de modelos, gestão de tráfego e cotas por usuário, API Key, projeto, dimensões de organização, isolamento multi-tenant, alcançando governança granular de chamadas de modelos
04 Contabilização precisa de custos
Transparência de custos de cadeia completa através de usuários consumidores, API Keys, projetos, organizações, modelos e computação, alcançando contabilização precisa de custos e controle orçamentário
05 Observabilidade de modelos de cadeia completa
Observabilidade multidimensional do volume de chamadas de modelos, desempenho e outras métricas, suportando governança precisa de modelos, gestão de ciclo de vida e ajuste de estratégias de roteamento, suportando testes A/B e lançamentos canary
06 Segurança de dados empresariais
Filtragem em tempo real de riscos de privacidade por dessensibilização bidirecional, interceptação de conteúdo sensível vinculada e registros de auditoria, garantindo que cada transação de negócios LLM seja conforme e rastreável
Segurança e Conformidade

Sistema de defesa em profundidade de ponta a ponta

Segurança orientada por inteligência, proteção de cadeia completa de dados a aplicação

🔐
Criptografia de ponta a ponta
Transmissão criptografada TLS de cadeia completa, criptografia de armazenamento de dados, sistema de gestão de chaves, garantindo segurança absoluta de dados em trânsito e em repouso
🛡️
Dessensibilização bidirecional
Filtragem de dessensibilização bidirecional em tempo real de entrada/saída, identificação e mascaramento automáticos de informações sensíveis, prevenção de vazamentos de dados de privacidade
📋
Registros de auditoria
Auditoria de operações de cadeia completa, cada chamada API rastreável e auditável, atendendo requisitos de conformidade em finanças, saúde e outras indústrias
🏢
Isolamento multi-tenant
Isolamento rigoroso de dados entre tenants, controle de permissões granular, suportando controle de acesso multidimensional por organização, projeto e usuário
🔒
Implantação privada
Os dados nunca saem do domínio, toda inferência é concluída dentro da intranet da empresa, atendendo os requisitos mais rigorosos de soberania de dados e conformidade
🚨
Detecção de segurança de conteúdo
实时防御潜在攻击,Detecção de segurança de conteúdo准确率超99%,敏感内容自动拦截,保障输出合规
Parceria

Modelos de colaboração flexíveis

Seja você tem computação ou precisa dela, a KHB oferece soluções de parceria adequadas

🤝 Operações conjuntas
Adequado para aqueles com recursos de computação que desejam adquirir rapidamente capacidades de serviço Token e atender clientes finais junto com a KHB
Parceiros típicos
Operadores IDC, centros de computação inteligente regionais, provedores de serviços cloud GPU, fabricantes de chips nacionais
Vantagens de valor
✓ Capacidade completa de produção Token, não precisa construir sua própria equipe técnica
✓ Com computação equivalente, throughput de inferência significativamente melhorado
✓ Compartilhamento de receita baseado no volume de serviço real
✓ Endosso de marca KHB e suporte de mercado
⚡ Absorção de computação / Compute-as-a-Service
Adequado para aqueles com clusters GPU autoconstruídos que desejam melhorar a eficiência de inferência, reduzir custos O&M, ou converter recursos redundantes em receitas de serviço Token
Parceiros típicos
Clientes governamentais/empresariais com computação autoconstruída, grandes empresas de internet, instituições financeiras, operadoras de telecomunicações
Vantagens de valor
✓ Eficiência de inferência significativamente melhorada, computação equivalente suporta maior escala de negócios
✓ Desempenho GPU plenamente utilizado, resolvendo desafios de adaptação
✓ Dados são executados em seu próprio ambiente, atendendo requisitos de conformidade de segurança
✓ Computação redundante pode fornecer serviços Token externamente, gerando receitas adicionais
Arquitetura técnica

Arquitetura de fluxo de dados da computação à aplicação

Arquitetura de quatro camadas, os dados fluem da esquerda para a direita, colaboração camada por camada, construindo um ciclo fechado de infraestrutura AI empresarial

Layer 01
Camada de recursos de computação
NVIDIA A100/H100
Huawei Ascend 910B
Muxi GPU
Moore Threads GPU
Layer 02
Camada de serviço de inferência
Carregamento e escalonamento de modelos
Otimização KV Cache
Continuous Batching
Quantização e aceleração
Layer 03
Camada de gateway API
Interface Compatível com OpenAI
Gateway de Roteamento Inteligente
Limitação de Taxa e Circuit Breaking
Medição e Faturamento de Token
Layer 04
Camada de aplicação
Atendimento ao Cliente Inteligente
Geração de Conteúdo
Análise de Dados
Soluções Setoriais
0
Modelos pré-integrados
0
Suporte de arquiteturas de chips
0
Redução de latência de inferência %
0
Aumento de throughput x
Serviços principais

Matriz de serviços ao redor do núcleo KHB·AI

Quatro serviços orbitam o núcleo, da computação subjacente ao gateway superior, cobertura de cadeia completa das necessidades de infraestrutura AI empresarial

KHB·AI
INFRASTRUCTURE
Operações de computação
Token Factory
Operações de computação GPU, convertendo eficientemente recursos GPU em produtividade Token. Suporta NVIDIA e chips nacionais, alcançando acesso unificado e escalonamento elástico de computação multi-arquitetura
🔒
Instâncias reservadas
Reserved Instances
Computação reservada dedicada, recursos exclusivos garantindo operação de negócios estável, precisão do modelo garantida, custos controláveis, compromisso SLA empresarial
🏗️
Plataforma MaaS
Enterprise MaaS
Plataforma de solução AI one-stop, gestão de computação heterogênea, treinamento de modelos, cobertura completa do processo de implantação de inferência, 100+ modelos pré-integrados, prontos para usar
🌐
Gateway AI
AI Gateway
Gateway de serviço LLM privado, gestão de acesso multi-modelo unificada, roteamento inteligente e limitação de taxa, observabilidade de cadeia completa, segurança de dados empresariais assegurada
Operações de computação
TOKEN FACTORY
GPU算力运营,将GPU资源高效转化为Token生产力。支持NVIDIA及国产芯片(昇腾、沐曦、摩尔线程),实现多架构算力统一接入与弹性调度
🔒
Instâncias reservadas
RESERVED INSTANCES
专属预留算力,独占式资源保障业务稳定运行。模型精度有保障,成本可控,企业级SLA承诺
🏗️
Plataforma MaaS
ENTERPRISE MAAS
Plataforma de solução AI one-stop, gestão de computação heterogênea, treinamento de modelos, cobertura completa do processo de implantação de inferência, 100+ modelos pré-integrados, prontos para usar
🌐
Gateway AI
AI GATEWAY
Gateway de serviço LLM privado, gestão de acesso multi-modelo unificada, roteamento inteligente e limitação de taxa, observabilidade de cadeia completa, segurança de dados empresariais assegurada
Vantagens

Por que escolher KHB

Os números não mentem, cada métrica é prova de força

0
Modelos pré-integrados
DeepSeek, GLM, Qwen, Kimi, GPT-4.1, Claude, Gemini e outros LLMs principais globais com acesso de um clique, atualizações dinâmicas de espelhos de modelos, novos modelos adaptados imediatamente, API pronta para chamar
0
Redução de latência de inferência
自研推理加速引擎,KV Cache深度优化与Continuous Batching,首Token延迟降低70%,无损精度动态量化,推理计算量减少60-80%
0
Aumento de throughput
异构算力弹性调度,单卡Token产出深度优化,同等算力下Aumento de throughput3至5倍,GPU集群利用率提升300%
0
Suporte de arquiteturas de chips
Suporte simultâneo de NVIDIA A100/H100, Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, gestão unificada e escalonamento inteligente multi-arquitetura, evitando bloqueio de fornecedor único
0
SLA de disponibilidade de serviço
Compromisso SLA empresarial de 99,9% de disponibilidade, implantação multi-AZ, failover automático e degradação Fallback, suporte técnico 7x24 garantindo continuidade do negócio
0
Detecção de segurança de conteúdo
Dessensibilização bidirecional实时过滤隐私风险,Detecção de segurança de conteúdo准确率超99%,联动敏感内容拦截与Registros de auditoria,数据泄露风险降低99%
0
Início rápido
可视化配置界面,3分钟内完成操作,30+开箱即用预置模板,Interface Compatível com OpenAI,无需深厚技术背景即可跨场景调用
0
Entrega de instâncias reservadas
Instâncias reservadas padrão implantadas em 1-7 dias úteis, a plataforma gerencia a implantação de modelos e verificação de desempenho, suporte de ajuste de desempenho de inferência, garantindo onboarding de negócios estável
Perguntas frequentes

Perguntas frequentes

Qual é a força da capacidade técnica da infraestrutura AI da KHB?
A KHB possui motores de operações de computação AI e aceleração de inferência de desenvolvimento próprio, com capacidades técnicas principais incluindo gestão unificada de computação heterogênea, implantação de modelos de alto desempenho e escalonamento por roteamento inteligente. Atendemos centenas de clientes empresariais em finanças, manufatura, saúde e outras indústrias, fornecendo serviços de infraestrutura AI de cadeia completa desde recursos de computação até implantação de aplicações.
Qual é a diferença entre instâncias reservadas e pagamento por uso?
Instâncias reservadas são recursos de computação dedicados não compartilhados com outros, garantindo precisão do modelo e estabilidade de inferência, adequados para cargas de trabalho de produção com requisitos rigorosos de latência e disponibilidade. O pagamento por uso utiliza pools de recursos compartilhados faturados pelo uso real, adequado para desenvolvimento/testes e cenários de negócios elásticos. O uso estável de longo prazo de instâncias reservadas é mais econômico.
Quais chips nacionais são suportados?
Atualmente suporta arquiteturas de chips nacionais Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, assim como GPUs internacionais principais NVIDIA A100/H100. Através da gestão unificada de computação heterogênea, as empresas podem escolher flexivelmente soluções de chips, evitando bloqueio de fornecedor único.
Como o gateway AI garante a segurança dos dados?
AI网关支持Implantação privada,所有数据在企业内网流转,不经过公网。提供数据脱敏、访问控制、全链路加密传输、操作Registros de auditoria等企业级安全能力,满足金融、医疗等行业的合规要求。
MaaS平台支持Implantação privada吗?
支持。MaaS平台提供公有云SaaS和Implantação privada两种模式。Implantação privada可将完整平台部署在企业数据中心,数据完全不出域,适合对数据安全有严格要求的行业客户。
Como começar com os serviços da KHB?
Você pode nos contatar através das informações de contato na parte inferior da página. Nossa equipe de soluções fornecerá propostas personalizadas baseadas nas suas necessidades de negócios. Desde discussão de requisitos, design de soluções, implantação de ambiente até manutenção, fornecemos suporte profissional durante todo o processo.
Por que as empresas precisam de um gateway AI se já têm APIs LLM?
À medida que as empresas introduzem múltiplos LLMs, problemas comuns surgem rapidamente: fontes diversas de modelos levam a protocolos API inconsistentes, cadeias de chamadas dispersas carecem de gestão unificada, diferentes aplicações têm requisitos SLA variados difíceis de satisfazer holisticamente, e volume de uso e custos são difíceis de medir. O gateway AI resolve centralmente esses problemas, fornecendo acesso unificado, roteamento inteligente, governança granular e observabilidade de cadeia completa.
O gateway AI adiciona sobrecarga de rede?
O gateway AI utiliza uma arquitetura proxy de alto desempenho, com latência adicional tipicamente dentro de 1-3ms, o que é insignificante comparado à latência de inferência LLM em si (centenas de milissegundos a segundos). Enquanto isso, o roteamento inteligente e a otimização do pool de conexões do gateway podem realmente reduzir a latência geral.
Como controlar os custos de uso de LLM através do gateway?
O gateway suporta a configuração de cotas de tráfego e políticas de limitação de taxa por usuário, API Key, projeto, organização e outras dimensões, fornecendo transparência de custos de cadeia completa e faturamento preciso, ajudando as empresas a monitorar custos de uso LLM em tempo real e evitar excessos orçamentários.
Quando uma empresa deve implantar uma plataforma MaaS privada?
As empresas devem considerar quando: 1) O negócio envolve dados sensíveis com requisitos rigorosos de soberania de dados; 2) Necessidade de implantar capacidades AI em larga escala em numerosos cenários com requisitos extremamente altos de desempenho e estabilidade de inferência; 3) Têm diversos ambientes de computação nacionais ou heterogêneos que requerem gestão unificada e utilização eficiente; 4) Desejam acompanhar o desenvolvimento tecnológico de AI mas carecem de equipe de engenharia para adaptação e otimização contínua de modelos.
Como os serviços AI internacionais e nacionais da KHB são divididos e aplicados?
I. Divisão de Entidades de Serviço
KHB INC (Corporação EUA): Fornece serviços API de modelos AI estrangeiros de todas as categorias, exclusivamente para empresas e pessoas estrangeiras com identidade estrangeira. Requisitos de acesso: certificação de qualificação completa, suporta cartão de crédito USD, USD e liquidação USDT. Este serviço é limitado a cenários estrangeiros e não deve ser transferido impropriamente para o âmbito nacional.
Hangzhou Kaihabesi Ecological Technology Co., Ltd.: Opera principalmente serviços API proxy LLM conformes nacionais, com todos os dados processados nacionalmente, aderindo estritamente a todas as leis e regulamentações nacionais.

II. Declaração de Direitos, Responsabilidades e Conformidade
As duas entidades operam independentemente, cada uma assumindo responsabilidade legal por seus respectivos serviços, sem responsabilidade solidária.
Atividades relacionadas a serviços AI estrangeiros seguem as regulamentações locais. Os usuários estão estritamente proibidos de usar interfaces estrangeiras para fornecer serviços nacionalmente ou transmitir impropriamente dados nacionais. Os infratores assumem as consequências.
Serviços nacionais são estritamente proibidos de serem utilizados em cenários ilegais ou não conformes. Os usuários devem cumprir os requisitos regulatórios nacionais.
A plataforma reserva-se o direito de verificar as qualificações de uso e pode suspender ou encerrar o serviço para contas não conformes.

KHB INC
Hangzhou Kaihabesi Ecological Technology Co., Ltd.
Lance sua infraestrutura AI

Seja você está explorando IA pela primeira vez ou buscando melhorias de computação e serviços de modelos, a KHB oferece soluções profissionais

Lançar LAUNCH
Consulta comercial: ai@khb.hk