Inicio Servicios Arquitectura Ventajas Escenarios Acerca de Volver al sitio principal Centro de Miembros
Clúster GPU en línea
Modelos listos
Disponibilidad API 99.99%

200+ Modelos, Cómputo Masivo, Una API para Todo

DeepSeek·GLM·Qwen·Kimi·Llama completamente integrados, plataforma de cómputo AI de nivel empresarial

Lista de modelos

Todos los modelos disponibles de un vistazo

101+ modelos pre-integrados, modelos clave listados abajo, actualizados continuamente

Modelo Parámetros Longitud de contexto Precisión Precio de entrada (ref.) Precio de salida (ref.) Estado
GPT-4.1 mini OpenAI1M¥2.80 /百万Token¥11.20 /百万TokenEn línea
GPT-4.1 Popular1M¥14.00 /百万Token¥56.00 /百万TokenEn línea
o3 Razonamiento200K¥14.00 /百万Token¥56.00 /百万TokenEn línea
Claude Sonnet 4.5 Anthropic200K¥21.00 /百万Token¥105.00 /百万TokenEn línea
Claude Haiku 3.5 Anthropic200K¥5.60 /百万Token¥28.00 /百万TokenEn línea
Gemini 2.5 Pro Google1M¥8.75 /百万Token¥70.00 /百万TokenEn línea
Gemini 2.5 Flash Google1M¥1.05 /百万Token¥4.20 /百万TokenEn línea
DeepSeek-V4 Pro Más reciente685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万TokenEn línea
DeepSeek-V4 Flash Más reciente685B MoE128KBF16¥0.50 /百万Token¥1.00 /百万TokenEn línea
DeepSeek-R1 Razonamiento685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万TokenEn línea
GLM-5 智谱200B+128KBF16¥1.00 /百万Token¥6.00 /百万TokenEn línea
GLM-5V-Turbo 多模态130B+128KBF16¥1.50 /百万Token¥3.00 /百万TokenEn línea
Qwen3.7 Max Más reciente397B MoE128KBF16¥2.00 /百万Token¥6.00 /百万TokenEn línea
Qwen3.6 Flash Rápido235B MoE128KBF16¥0.30 /百万Token¥0.60 /百万TokenEn línea
Qwen3-Coder-Next Código235B MoE128KBF16¥1.50 /百万Token¥3.50 /百万TokenEn línea
Kimi-K2.5 Más reciente1T MoE256KBF16¥2.50 /百万Token¥5.00 /百万TokenEn línea
Kimi-K2 Thinking Razonamiento1T MoE256KBF16¥3.00 /百万Token¥6.00 /百万TokenEn línea
MiniMax-M2.5 Más reciente456B MoE1MBF16¥2.00 /百万Token¥4.00 /百万TokenEn línea
MiniMax-M2.5 Highspeed Rápido456B MoE1MBF16¥1.00 /百万Token¥2.00 /百万TokenEn línea
Doubao Seed 2.0 Pro 豆包128KBF16¥1.50 /百万Token¥3.00 /百万TokenEn línea
Doubao Seed 2.0 Code Preview Código128KBF16¥1.00 /百万Token¥2.00 /百万TokenEn línea
Llama-4 Meta400B MoE1MBF16¥2.50 /百万Token¥5.00 /百万TokenEn línea
Yi-Lightning 零一万物64KBF16¥0.50 /百万Token¥1.50 /百万TokenEn línea
Step-2 阶跃星辰128KBF16¥1.50 /百万Token¥3.20 /百万TokenEn línea
Hy3 Preview 混元128KBF16¥1.00 /百万Token¥2.00 /百万TokenEn línea
BAAI/bge-m3 Embedding568M8KFP16¥0.02 /百万TokenEn línea
Casos de uso

Un comando, despliega tu IA

Explora las soluciones de despliegue de infraestructura AI de KHB en todas las industrias, al estilo desarrollador

enterprise-ai.sh
$ khb deploy --scenario=enterprise --model=DeepSeek-V3.2
算力资源分配完成
模型加载完成 DeepSeek-V3.2
API网关配置完成
企业AI平台已就绪
ENDPOINT: https://api.khb.com/v1/enterprise
STATUS: RUNNING
compute-center.sh
$ khb deploy --scenario=compute --chip=ascend,nvidia
异构算力统一纳管启动
NVIDIA A100 × 128 已接入
昇腾910B × 64 已接入
弹性调度引擎就绪
UTILIZATION: 94.7%
finance.sh
$ khb deploy --scenario=finance --security=private
Despliegue privado环境初始化
数据隔离策略已启用
全链路加密传输已开启
Registros de auditoría系统就绪
COMPLIANCE: PASSED
manufacturing.sh
$ khb deploy --scenario=manufacturing --instance=reserved
预留实例资源锁定
工业AI模型部署完成
7×24 SLA保障已启用
质检模型推理延迟 <50ms
UPTIME: 99.99%
Instancias reservadas

Asegura el cómputo, protege tu negocio crítico

Cómputo reservado dedicado · Precisión del modelo garantizada · Costos controlables · SLA empresarial

DeepSeek-V3.2
deepseek-ai/DeepSeek-V3.2
Precio ¥594,000/组/月
Precio unitario efectivo ¥2.20/M tokens
TPM 1,250万
TTFT 1,600ms
TPS 45
Contexto 1M
Adecuado para razonamiento complejo y análisis de decisiones de nivel empresarial, generación de código y asistencia de desarrollo de software, llamadas de herramientas de agentes
GLM-5
zai-org/GLM-5
Precio ¥594,000/组/月
Precio unitario efectivo ¥2.75/M tokens
TPM 1,000万
TTFT 1,500ms
TPS 30
Contexto 1M
Adecuado para desarrollo de agentes de nivel empresarial, planificación de tareas complejas y ejecución multi-paso, automatización de ingeniería de software
Kimi-K2.5
moonshotai/Kimi-K2.5
Precio ¥594,000/组/月
Precio unitario efectivo ¥6.88/M tokens
TPM 400万
TTFT 1,500ms
TPS 30
Contexto 256K
Adecuado para desarrollo de agentes multimodales de nivel empresarial, comprensión y análisis de contenido visual, automatización de tareas complejas
MiniMax-M2.5
MiniMaxAI/MiniMax-M2.5
Precio ¥297,000/组/月
Precio unitario efectivo ¥2.75/M tokens
TPM 500万
TTFT 500ms
TPS 30
Contexto 1M
Adecuado para análisis de documentos largos y bases de conocimiento de nivel empresarial, servicio al cliente inteligente y generación de contenido, automatización de procesos de negocio
* Precio unitario efectivo basado en TPM, calculado con 30 días/mes y 50% de utilización global. Datos de rendimiento basados en parámetros de inferencia típicos: 24K Token de entrada, 1K Token de salida, tasa de acierto de caché del 80%. (Actualizado el 20 de mayo de 2026)
Gateway AI

Gateway de servicio LLM privado

Gestión unificada · Enrutamiento inteligente · Limitación de tasa · Observabilidad de cadena completa

01 Acceso multi-modelo unificado
Acceso one-stop y llamada estandarizada de modelos de diferentes proveedores, soportando interfaces compatibles con OpenAI, eliminando gestión puntual, gestionando fácilmente ecosistemas multi-proveedor
02 Enrutamiento inteligente y balanceo de carga
Enrutamiento dinámico inteligente combinando características de tráfico y características de servicio LLM, balanceo de carga, conmutación por error Fallback, asegurando estabilidad del servicio y SLA de negocio
03 Gobernanza granular y limitación de tasa
Configuración de permisos de modelos, gestión de tráfico y cuotas por usuario, API Key, proyecto, dimensiones de organización, aislamiento multi-tenant, logrando gobernanza granular de llamadas de modelos
04 Contabilización precisa de costos
Transparencia de costos de cadena completa a través de usuarios consumidores, API Keys, proyectos, organizaciones, modelos y cómputo, logrando contabilización precisa de costos y control presupuestario
05 Observabilidad de modelos de cadena completa
Observabilidad multidimensional del volumen de llamadas de modelos, rendimiento y otras métricas, soportando gobernanza precisa de modelos, gestión de ciclo de vida y ajuste de estrategias de enrutamiento, soportando pruebas A/B y lanzamientos canary
06 Seguridad de datos empresariales
Filtrado en tiempo real de riesgos de privacidad por desensibilización bidireccional, interceptación de contenido sensible vinculada y registros de auditoría, asegurando que cada transacción de negocio LLM sea conforme y rastreable
Seguridad y Cumplimiento

Sistema de defensa en profundidad de extremo a extremo

Seguridad impulsada por inteligencia, protección de cadena completa de datos a aplicación

🔐
Cifrado de extremo a extremo
Transmisión cifrada TLS de cadena completa, cifrado de almacenamiento de datos, sistema de gestión de claves, asegurando seguridad absoluta de datos en tránsito y en reposo
🛡️
Desensibilización bidireccional
Filtrado de desensibilización bidireccional en tiempo real de entrada/salida, identificación y enmascaramiento automáticos de información sensible, prevención de fugas de datos de privacidad
📋
Registros de auditoría
Auditoría de operaciones de cadena completa, cada llamada API rastreable y auditable, cumpliendo requisitos de cumplimiento en finanzas, salud y otras industrias
🏢
Aislamiento multi-tenant
Aislamiento estricto de datos entre tenants, control de permisos granular, soportando control de acceso multidimensional por organización, proyecto y usuario
🔒
Despliegue privado
Los datos nunca salen del dominio, toda la inferencia se completa dentro de la intranet de la empresa, cumpliendo los requisitos más estrictos de soberanía de datos y cumplimiento
🚨
Detección de seguridad de contenido
实时防御潜在攻击,Detección de seguridad de contenido准确率超99%,敏感内容自动拦截,保障输出合规
Asociación

Modelos de colaboración flexibles

Ya sea que tenga cómputo o lo necesite, KHB ofrece soluciones de asociación adaptadas

🤝 Operaciones conjuntas
Adecuado para aquellos con recursos de cómputo que desean adquirir rápidamente capacidades de servicio Token y servir clientes finales junto con KHB
Socios típicos
Operadores IDC, centros de cómputo inteligente regionales, proveedores de servicios cloud GPU, fabricantes de chips nacionales
Ventajas de valor
✓ Capacidad completa de producción Token, no necesita construir su propio equipo técnico
✓ Con cómputo equivalente, rendimiento de inferencia significativamente mejorado
✓ Participación de ingresos basada en volumen de servicio real
✓ Respaldo de marca KHB y soporte de mercado
⚡ Absorción de cómputo / Compute-as-a-Service
Adecuado para aquellos con clústeres GPU autoconstruidos que desean mejorar la eficiencia de inferencia, reducir costos O&M, o convertir recursos redundantes en ingresos de servicio Token
Socios típicos
Clientes gubernamentales/empresariales con cómputo autoconstruido, grandes empresas de internet, instituciones financieras, operadores de telecomunicaciones
Ventajas de valor
✓ Eficiencia de inferencia significativamente mejorada, cómputo equivalente soporta mayor escala de negocio
✓ Rendimiento GPU plenamente utilizado, resolviendo desafíos de adaptación
✓ Datos se ejecutan en su propio entorno, cumpliendo requisitos de cumplimiento de seguridad
✓ Cómputo redundante puede proporcionar servicios Token externamente, generando ingresos adicionales
Arquitectura técnica

Arquitectura de flujo de datos del cómputo a la aplicación

Arquitectura de cuatro capas, los datos fluyen de izquierda a derecha, colaboración capa por capa, construyendo un ciclo cerrado de infraestructura AI empresarial

Layer 01
Capa de recursos de cómputo
NVIDIA A100/H100
Huawei Ascend 910B
Muxi GPU
Moore Threads GPU
Layer 02
Capa de servicio de inferencia
Carga y programación de modelos
Optimización KV Cache
Continuous Batching
Cuantización y aceleración
Layer 03
Capa de gateway API
Interfaz compatible con OpenAI
Gateway de enrutamiento inteligente
Limitación de tasa y circuit breaker
Medición y facturación de Token
Layer 04
Capa de aplicación
Servicio al cliente inteligente
Generación de contenido
Análisis de datos
Soluciones industriales
0
Modelos pre-integrados
0
Soporte de arquitecturas de chips
0
Reducción de latencia de inferencia %
0
Aumento de rendimiento x
Servicios principales

Matriz de servicios alrededor del núcleo KHB·AI

Cuatro servicios orbitan el núcleo, desde el cómputo subyacente hasta el gateway superior, cobertura de cadena completa de necesidades de infraestructura AI empresarial

KHB·AI
INFRASTRUCTURE
Operaciones de cómputo
Token Factory
Operaciones de cómputo GPU, convirtiendo eficientemente recursos GPU en productividad Token. Soporta NVIDIA y chips nacionales, logrando acceso unificado y programación elástica de cómputo multi-arquitectura
🔒
Instancias reservadas
Reserved Instances
Cómputo reservado dedicado, recursos exclusivos asegurando operación comercial estable, precisión del modelo garantizada, costos controlables, compromiso SLA empresarial
🏗️
Plataforma MaaS
Enterprise MaaS
Plataforma de solución AI one-stop, gestión de cómputo heterogéneo, entrenamiento de modelos, cobertura completa del proceso de despliegue de inferencia, 100+ modelos pre-integrados, listos para usar
🌐
Gateway AI
AI Gateway
Gateway de servicio LLM privado, gestión de acceso multi-modelo unificada, enrutamiento inteligente y limitación de tasa, observabilidad de cadena completa, seguridad de datos empresariales asegurada
Operaciones de cómputo
TOKEN FACTORY
GPU算力运营,将GPU资源高效转化为Token生产力。支持NVIDIA及国产芯片(昇腾、沐曦、摩尔线程),实现多架构算力统一接入与弹性调度
🔒
Instancias reservadas
RESERVED INSTANCES
专属预留算力,独占式资源保障业务稳定运行。模型精度有保障,成本可控,企业级SLA承诺
🏗️
Plataforma MaaS
ENTERPRISE MAAS
Plataforma de solución AI one-stop, gestión de cómputo heterogéneo, entrenamiento de modelos, cobertura completa del proceso de despliegue de inferencia, 100+ modelos pre-integrados, listos para usar
🌐
Gateway AI
AI GATEWAY
Gateway de servicio LLM privado, gestión de acceso multi-modelo unificada, enrutamiento inteligente y limitación de tasa, observabilidad de cadena completa, seguridad de datos empresariales asegurada
Ventajas

Por qué elegir KHB

Los números no mienten, cada métrica es prueba de fuerza

0
Modelos pre-integrados
DeepSeek, GLM, Qwen, Kimi, GPT-4.1, Claude, Gemini y otros LLMs principales globales con acceso de un clic, actualizaciones dinámicas de espejos de modelos, nuevos modelos adaptados inmediatamente, API lista para llamar
0
Reducción de latencia de inferencia
自研推理加速引擎,KV Cache深度优化与Continuous Batching,首Token延迟降低70%,无损精度动态量化,推理计算量减少60-80%
0
Aumento de rendimiento
异构算力弹性调度,单卡Token产出深度优化,同等算力下Aumento de rendimiento3至5倍,GPU集群利用率提升300%
0
Soporte de arquitecturas de chips
Soporte simultáneo de NVIDIA A100/H100, Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, gestión unificada y programación inteligente multi-arquitectura, evitando el bloqueo de proveedor único
0
SLA de disponibilidad de servicio
Compromiso SLA empresarial de 99.9% de disponibilidad, despliegue multi-AZ, conmutación automática por error y degradación Fallback, soporte técnico 7x24 asegurando continuidad del negocio
0
Detección de seguridad de contenido
Desensibilización bidireccional实时过滤隐私风险,Detección de seguridad de contenido准确率超99%,联动敏感内容拦截与Registros de auditoría,数据泄露风险降低99%
0
Inicio rápido
可视化配置界面,3分钟内完成操作,30+开箱即用预置模板,Interfaz compatible con OpenAI,无需深厚技术背景即可跨场景调用
0
Entrega de instancias reservadas
Instancias reservadas estándar desplegadas en 1-7 días hábiles, la plataforma gestiona el despliegue de modelos y la verificación de rendimiento, soporte de ajuste de rendimiento de inferencia, asegurando la incorporación comercial estable
Preguntas frecuentes

Preguntas frecuentes

¿Qué tan fuerte es la capacidad técnica de la infraestructura AI de KHB?
KHB tiene motores de operaciones de cómputo AI y aceleración de inferencia de desarrollo propio, con capacidades técnicas clave que incluyen gestión unificada de cómputo heterogéneo, despliegue de modelos de alto rendimiento y programación de enrutamiento inteligente. Hemos servido a cientos de clientes empresariales en finanzas, manufactura, salud y otras industrias, proporcionando servicios de infraestructura AI de cadena completa desde recursos de cómputo hasta despliegue de aplicaciones.
¿Cuál es la diferencia entre instancias reservadas y pago por uso?
Las instancias reservadas son recursos de cómputo dedicados no compartidos con otros, asegurando precisión del modelo y estabilidad de inferencia, adecuadas para cargas de trabajo de producción con requisitos estrictos de latencia y disponibilidad. El pago por uso utiliza pools de recursos compartidos facturados por uso real, adecuado para desarrollo/pruebas y escenarios de negocio elásticos. El uso estable a largo plazo de instancias reservadas es más rentable.
¿Qué chips nacionales son compatibles?
Actualmente soporta arquitecturas de chips nacionales Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, así como GPUs internacionales principales NVIDIA A100/H100. A través de la gestión unificada de cómputo heterogéneo, las empresas pueden elegir flexiblemente soluciones de chips, evitando el bloqueo de proveedor único.
¿Cómo asegura el gateway AI la seguridad de los datos?
AI网关支持Despliegue privado,所有数据在企业内网流转,不经过公网。提供数据脱敏、访问控制、全链路加密传输、操作Registros de auditoría等企业级安全能力,满足金融、医疗等行业的合规要求。
MaaS平台支持Despliegue privado吗?
支持。MaaS平台提供公有云SaaS和Despliegue privado两种模式。Despliegue privado可将完整平台部署在企业数据中心,数据完全不出域,适合对数据安全有严格要求的行业客户。
¿Cómo inicio con los servicios de KHB?
Puede contactarnos a través de la información de contacto en la parte inferior de la página. Nuestro equipo de soluciones proporcionará propuestas personalizadas basadas en sus necesidades de negocio. Desde discusión de requisitos, diseño de soluciones, despliegue de entorno hasta mantenimiento, proporcionamos soporte profesional durante todo el proceso.
¿Por qué las empresas necesitan un gateway AI si ya tienen APIs LLM?
A medida que las empresas introducen múltiples LLMs, surgen rápidamente problemas comunes: fuentes de modelos diversas llevan a protocolos API inconsistentes, cadenas de llamadas dispersas carecen de gestión unificada, diferentes aplicaciones tienen requisitos SLA variables difíciles de satisfacer holísticamente, y el volumen de uso y costos son difíciles de medir. El gateway AI resuelve centralmente estos problemas, proporcionando acceso unificado, enrutamiento inteligente, gobernanza granular y observabilidad de cadena completa.
¿El gateway AI añade sobrecarga de red?
El gateway AI utiliza una arquitectura proxy de alto rendimiento, con latencia adicional típicamente dentro de 1-3ms, lo cual es insignificante comparado con la latencia de inferencia LLM en sí (cientos de milisegundos a segundos). Mientras tanto, el enrutamiento inteligente y la optimización del pool de conexiones del gateway pueden realmente reducir la latencia general.
¿Cómo controlar los costos de uso de LLM a través del gateway?
El gateway soporta la configuración de cuotas de tráfico y políticas de limitación de tasa por usuario, API Key, proyecto, organización y otras dimensiones, proporcionando transparencia de costos de cadena completa y facturación precisa, ayudando a las empresas a monitorear costos de uso LLM en tiempo real y evitar excesos presupuestarios.
¿Cuándo debe una empresa desplegar una plataforma MaaS privada?
Las empresas deberían considerarlo cuando: 1) El negocio involucra datos sensibles con requisitos estrictos de soberanía de datos; 2) Necesidad de desplegar capacidades AI a gran escala en numerosos escenarios con requisitos extremadamente altos de rendimiento y estabilidad de inferencia; 3) Tienen diversos entornos de cómputo nacionales o heterogéneos que requieren gestión unificada y utilización eficiente; 4) Quieren seguir el desarrollo tecnológico de AI pero carecen de equipo de ingeniería para adaptación y optimización continua de modelos.
¿Cómo se dividen y aplican los servicios AI internacionales y nacionales de KHB?
I. División de Entidades de Servicio
KHB INC (Corporación EE.UU.): Proporciona servicios API de modelos AI extranjeros de todas las categorías, exclusivamente para empresas y personas extranjeras con identidad extranjera. Requisitos de acceso: certificación de calificación completa, soporta tarjeta de crédito USD, USD y liquidación USDT. Este servicio se limita a escenarios extranjeros y no debe transferirse impropiadamente a nivel nacional.
Hangzhou Kaihabesi Ecological Technology Co., Ltd.: Opera principalmente servicios API proxy LLM conformes nacionales, con todos los datos procesados nacionalmente, cumpliendo estrictamente todas las leyes y regulaciones nacionales.

II. Declaración de Derechos, Responsabilidades y Cumplimiento
Las dos entidades operan independientemente, cada una asumiendo responsabilidad legal por sus respectivos servicios, sin responsabilidad solidaria.
Las actividades relacionadas con servicios AI extranjeros siguen las regulaciones locales. Los usuarios tienen estrictamente prohibido usar interfaces extranjeras para proporcionar servicios a nivel nacional o transmitir impropiadamente datos nacionales. Los infractores asumen las consecuencias.
Los servicios nacionales están estrictamente prohibidos de ser utilizados en escenarios ilegales o no conformes. Los usuarios deben cumplir con los requisitos regulatorios nacionales.
La plataforma se reserva el derecho de verificar las calificaciones de uso y puede suspender o terminar el servicio para cuentas no conformes.

KHB INC
Hangzhou Kaihabesi Ecological Technology Co., Ltd.
Lanza tu infraestructura AI

Ya sea que explores IA por primera vez o busques mejoras de cómputo y servicios de modelos, KHB ofrece soluciones profesionales

Lanzar LAUNCH
Consulta comercial: ai@khb.hk