Startseite Dienstleistungen Architektur Vorteile Szenarien Über uns Zurück zur Hauptseite Mitgliedercenter
GPU-Cluster online
Modelle bereit
API-Verfügbarkeit 99.99%

200+ Modelle, Massenrechenleistung, Eine API für alles

DeepSeek·GLM·Qwen·Kimi·Llama vollständig integriert, Enterprise-Klasse AI-Rechenplattform

Modellliste

Alle verfügbaren Modelle auf einen Blick

101+ Modelle vorintegriert, Kernmodelle unten aufgeführt, kontinuierlich aktualisiert

Modell Parameter Kontextlänge Präzision Eingabepreis (Ref.) Ausgabepreis (Ref.) Status
GPT-4.1 mini OpenAI1M¥2.80 /百万Token¥11.20 /百万TokenOnline
GPT-4.1 Beliebt1M¥14.00 /百万Token¥56.00 /百万TokenOnline
o3 Reasoning200K¥14.00 /百万Token¥56.00 /百万TokenOnline
Claude Sonnet 4.5 Anthropic200K¥21.00 /百万Token¥105.00 /百万TokenOnline
Claude Haiku 3.5 Anthropic200K¥5.60 /百万Token¥28.00 /百万TokenOnline
Gemini 2.5 Pro Google1M¥8.75 /百万Token¥70.00 /百万TokenOnline
Gemini 2.5 Flash Google1M¥1.05 /百万Token¥4.20 /百万TokenOnline
DeepSeek-V4 Pro Neueste685B MoE128KBF16¥12.00 /百万Token¥24.00 /百万TokenOnline
DeepSeek-V4 Flash Neueste685B MoE128KBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
DeepSeek-R1 Reasoning685B MoE128KBF16¥2.00 /百万Token¥5.00 /百万TokenOnline
GLM-5 智谱200B+128KBF16¥1.00 /百万Token¥6.00 /百万TokenOnline
GLM-5V-Turbo 多模态130B+128KBF16¥1.50 /百万Token¥3.00 /百万TokenOnline
Qwen3.7 Max Neueste397B MoE128KBF16¥2.00 /百万Token¥6.00 /百万TokenOnline
Qwen3.6 Flash Schnell235B MoE128KBF16¥0.30 /百万Token¥0.60 /百万TokenOnline
Qwen3-Coder-Next Code235B MoE128KBF16¥1.50 /百万Token¥3.50 /百万TokenOnline
Kimi-K2.5 Neueste1T MoE256KBF16¥2.50 /百万Token¥5.00 /百万TokenOnline
Kimi-K2 Thinking Reasoning1T MoE256KBF16¥3.00 /百万Token¥6.00 /百万TokenOnline
MiniMax-M2.5 Neueste456B MoE1MBF16¥2.00 /百万Token¥4.00 /百万TokenOnline
MiniMax-M2.5 Highspeed Schnell456B MoE1MBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
Doubao Seed 2.0 Pro 豆包128KBF16¥1.50 /百万Token¥3.00 /百万TokenOnline
Doubao Seed 2.0 Code Preview Code128KBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
Llama-4 Meta400B MoE1MBF16¥2.50 /百万Token¥5.00 /百万TokenOnline
Yi-Lightning 零一万物64KBF16¥0.50 /百万Token¥1.50 /百万TokenOnline
Step-2 阶跃星辰128KBF16¥1.50 /百万Token¥3.20 /百万TokenOnline
Hy3 Preview 混元128KBF16¥1.00 /百万Token¥2.00 /百万TokenOnline
BAAI/bge-m3 Embedding568M8KFP16¥0.02 /百万TokenOnline
Anwendungsfälle

Ein Befehl, deployen Sie Ihre KI

Erkunden Sie KHB AI-Infrastruktur-Deployments branchenübergreifend, auf Entwicklerart

enterprise-ai.sh
$ khb deploy --scenario=enterprise --model=DeepSeek-V3.2
算力资源分配完成
模型加载完成 DeepSeek-V3.2
API网关配置完成
企业AI平台已就绪
ENDPOINT: https://api.khb.com/v1/enterprise
STATUS: RUNNING
compute-center.sh
$ khb deploy --scenario=compute --chip=ascend,nvidia
异构算力统一纳管启动
NVIDIA A100 × 128 已接入
昇腾910B × 64 已接入
弹性调度引擎就绪
UTILIZATION: 94.7%
finance.sh
$ khb deploy --scenario=finance --security=private
Private Deployment环境初始化
数据隔离策略已启用
全链路加密传输已开启
Audit-Logs系统就绪
COMPLIANCE: PASSED
manufacturing.sh
$ khb deploy --scenario=manufacturing --instance=reserved
预留实例资源锁定
工业AI模型部署完成
7×24 SLA保障已启用
质检模型推理延迟 <50ms
UPTIME: 99.99%
Reservierte Instanzen

Rechenleistung sichern, geschäftskritische Prozesse schützen

Dedizierte reservierte Rechenleistung · Modellpräzision garantiert · Kosten kontrollierbar · Enterprise-SLA

DeepSeek-V3.2
deepseek-ai/DeepSeek-V3.2
Preis ¥594,000/组/月
Effektiver Einheitspreis ¥2.20/M tokens
TPM 1,250万
TTFT 1,600ms
TPS 45
Kontext 1M
Geeignet für Enterprise-komplexes Reasoning und Entscheidungsanalyse, Codegenerierung und Softwareentwicklungsunterstützung, Agent-Tool-Aufrufe
GLM-5
zai-org/GLM-5
Preis ¥594,000/组/月
Effektiver Einheitspreis ¥2.75/M tokens
TPM 1,000万
TTFT 1,500ms
TPS 30
Kontext 1M
Geeignet für Enterprise-Agent-Entwicklung, komplexe Aufgabenplanung und Mehrschrittausführung, Software-Engineering-Automatisierung
Kimi-K2.5
moonshotai/Kimi-K2.5
Preis ¥594,000/组/月
Effektiver Einheitspreis ¥6.88/M tokens
TPM 400万
TTFT 1,500ms
TPS 30
Kontext 256K
Geeignet für Enterprise-multimodale Agent-Entwicklung, visuelle Inhaltsverständnis und -analyse, komplexe Aufgabenautomatisierung
MiniMax-M2.5
MiniMaxAI/MiniMax-M2.5
Preis ¥297,000/组/月
Effektiver Einheitspreis ¥2.75/M tokens
TPM 500万
TTFT 500ms
TPS 30
Kontext 1M
Geeignet für Enterprise-Langdokument- und Wissensbasis-Analyse, intelligenten Kundenservice und Inhaltserstellung, Geschäftsprozessautomatisierung
* Effektiver Einheitspreis basierend auf TPM, berechnet mit 30 Tagen/Monat und 50% Gesamtauslastung. Leistungsdaten basierend auf typischen Inferenzparametern: 24K Eingabe-Token, 1K Ausgabe-Token, 80% Cache-Trefferrate. (Aktualisiert am 20. Mai 2026)
AI-Gateway

Privates LLM-Service-Gateway

Einheitsverwaltung · Intelligentes Routing · Ratenbegrenzung · Vollketten-Observabilität

01 Einheitlicher Multi-Modell-Zugang
One-Stop-Zugang und standardisierter Aufruf von Modellen verschiedener Anbieter, Unterstützung OpenAI-kompatibler Schnittstellen, Eliminierung der Punktverwaltung, einfache Verwaltung von Multi-Vendor-Ökosystemen
02 Intelligentes Routing & Lastverteilung
Intelligentes dynamisches Routing unter Kombination von Traffic- und LLM-Service-Eigenschaften, Lastverteilung, Fallback-Failover, Gewährleistung von Service-Stabilität und Business-SLA
03 Feinkörnige Governance & Ratenbegrenzung
Konfiguration von Modellberechtigungen, Traffic- und Quotenmanagement nach Benutzer, API-Key, Projekt, Organisationsdimensionen, Multi-Tenant-Isolation, Erreichung feinkörniger Modellaufruf-Governance
04 Genaue Kostenabrechnung
Vollketten-Kostentransparenz über Konsumentenbenutzer, API-Keys, Projekte, Organisationen, Modelle und Compute, Erreichung genauer Kostenabrechnung und Budgetsteuerung
05 Vollketten-Modell-Observabilität
Mehrdimensionale Observabilität von Modellaufrufvolumen, Leistung und anderen Metriken, Unterstützung präziser Modell-Governance, Lebenszyklusmanagement und Routing-Strategieanpassung, Unterstützung von A/B-Tests und Canary-Releases
06 Enterprise-Datensicherheit
Bidirektionale Desensibilisierung Echtzeit-Privatsphäre-Risikofilterung, verknüpfte sensible Inhalt-Abfangung und Audit-Logs, Gewährleistung dass jede LLM-Geschäftstransaktion konform und rückverfolgbar ist
Sicherheit & Compliance

End-to-End Defense-in-Depth-System

Intelligenzgesteuerte Sicherheit, Vollketten-Schutz von Daten bis Anwendung

🔐
End-to-End-Verschlüsselung
Vollketten-TLS-verschlüsselte Übertragung, Datenspeicherverschlüsselung, Schlüsselmanagementsystem, Gewährleistung absoluter Sicherheit von Daten in Transit und im Ruhezustand
🛡️
Bidirektionale Desensibilisierung
Ein-/Ausgabe bidirektionale Echtzeit-Desensibilisierungsfilterung, automatische Identifizierung und Maskierung sensibler Informationen, Verhinderung von Privatsphäre-Datenlecks
📋
Audit-Logs
Vollketten-Betriebsaudit, jeder API-Aufruf rückverfolgbar und prüfbar, Erfüllung von Compliance-Anforderungen in Finanz-, Gesundheitswesen und anderen Branchen
🏢
Multi-Tenant-Isolation
Strenge Datenisolation zwischen Tenants, feinkörnige Berechtigungssteuerung, Unterstützung mehrdimensionaler Zugriffssteuerung nach Organisation, Projekt und Benutzer
🔒
Private Deployment
Daten verlassen nie die Domäne, gesamte Inferenz innerhalb des Unternehmens-Intranets abgeschlossen, Erfüllung der strengsten Datensouveränitäts- und Compliance-Anforderungen
🚨
Inhaltssicherheitserkennung
实时防御潜在攻击,Inhaltssicherheitserkennung准确率超99%,敏感内容自动拦截,保障输出合规
Partnerschaft

Flexible Zusammenarbeitsmodelle

Ob Sie Rechenleistung haben oder benötigen, KHB bietet passende Partnerschaftslösungen

🤝 Gemeinschaftsbetrieb
Geeignet für diejenigen mit Rechenressourcen, die schnell Token-Service-Fähigkeiten erwerben und Endkunden gemeinsam mit KHB bedienen möchten
Typische Partner
IDC-Betreiber, regionale Intelligent-Compute-Zentren, GPU-Cloud-Dienstleister, inländische Chip-Hersteller
Mehrwert-Vorteile
✓ Vollständige Token-Produktionsfähigkeit, kein eigenes Technikteam nötig
✓ Bei äquivalentem Compute Inferenz-Durchsatz deutlich verbessert
✓ Umsatzbeteiligung basierend auf tatsächlichem Servicevolumen
✓ KHB-Markenunterstützung und Marktsupport
⚡ Compute-Absorption / Compute-as-a-Service
Geeignet für diejenigen mit selbstgebauten GPU-Clustern, die Inferenzeffizienz verbessern, O&M-Kosten senken oder redundante Ressourcen in Token-Service-Einnahmen umwandeln möchten
Typische Partner
Regierungs-/Unternehmenskunden mit selbstgebautem Compute, große Internetunternehmen, Finanzinstitute, Telekommunikationsbetreiber
Mehrwert-Vorteile
✓ Inferenzeffizienz deutlich verbessert, äquivalenter Compute unterstützt größeres Geschäftsvolumen
✓ GPU-Leistung voll ausgenutzt, Adaptionsherausforderungen gelöst
✓ Daten laufen in eigener Umgebung, Erfüllung von Sicherheits-Compliance-Anforderungen
✓ Redundanter Compute kann externe Token-Dienste anbieten, zusätzliche Einnahmen generieren
Technische Architektur

Von Rechenleistung zur Anwendung Datenfluss-Architektur

Vierschichtige Architektur, Daten fließen von links nach rechts, schichtweise Zusammenarbeit, Aufbau eines Enterprise-AI-Infrastruktur-Geschlossenkreises

Layer 01
Rechenressourcen-Schicht
NVIDIA A100/H100
Huawei Ascend 910B
Muxi GPU
Moore Threads GPU
Layer 02
Inferenzservice-Schicht
Modell-Laden & Planung
KV-Cache-Optimierung
Continuous Batching
Quantisierung & Beschleunigung
Layer 03
API-Gateway-Schicht
OpenAI-kompatible Schnittstelle
Intelligentes Routing-Gateway
Rate Limiting & Circuit Breaking
Token-Messung und Abrechnung
Layer 04
Anwendungsschicht
Intelligenter Kundenservice
Content-Erstellung
Datenanalyse
Branchenlösungen
0
Vorintegrierte Modelle
0
Chip-Architektur-Support
0
Inferenzlatenz-Reduktion %
0
Durchsatzsteigerung x
Kerndienste

Servicematrix rund um den KHB·AI-Kern

Vier Dienste umkreisen den Kern, von der zugrundeliegenden Rechenleistung bis zum oberen Gateway, Vollketten-Abdeckung der Enterprise-AI-Infrastruktur-Bedarfe

KHB·AI
INFRASTRUCTURE
Rechenbetrieb
Token Factory
GPU-Rechenbetrieb, effiziente Umwandlung von GPU-Ressourcen in Token-Produktivität. Unterstützt NVIDIA und inländische Chips, Erreichung von Multi-Architektur-Compute-Einheitszugang und elastischer Planung
🔒
Reservierte Instanzen
Reserved Instances
Dedizierter reservierter Compute, exklusive Ressourcen gewährleisten stabilen Geschäftsbetrieb, Modellpräzision garantiert, Kosten kontrollierbar, Enterprise-SLA-Zusage
🏗️
MaaS-Plattform
Enterprise MaaS
One-Stop-AI-Lösungsplattform, heterogenes Compute-Management, Modelltraining, Inferenz-Deployment-Vollprozessabdeckung, 100+ Modelle vorintegriert, sofort einsatzbereit
🌐
AI-Gateway
AI Gateway
Privates LLM-Service-Gateway, einheitliches Multi-Modell-Zugangsmanagement, intelligentes Routing und Ratenbegrenzung, Vollketten-Observabilität, Enterprise-Datensicherheit gewährleistet
Rechenbetrieb
TOKEN FACTORY
GPU算力运营,将GPU资源高效转化为Token生产力。支持NVIDIA及国产芯片(昇腾、沐曦、摩尔线程),实现多架构算力统一接入与弹性调度
🔒
Reservierte Instanzen
RESERVED INSTANCES
专属预留算力,独占式资源保障业务稳定运行。模型精度有保障,成本可控,企业级SLA承诺
🏗️
MaaS-Plattform
ENTERPRISE MAAS
One-Stop-AI-Lösungsplattform, heterogenes Compute-Management, Modelltraining, Inferenz-Deployment-Vollprozessabdeckung, 100+ Modelle vorintegriert, sofort einsatzbereit
🌐
AI-Gateway
AI GATEWAY
Privates LLM-Service-Gateway, einheitliches Multi-Modell-Zugangsmanagement, intelligentes Routing und Ratenbegrenzung, Vollketten-Observabilität, Enterprise-Datensicherheit gewährleistet
Vorteile

Warum KHB wählen

Zahlen lügen nicht, jede Metrik ist ein Beweis von Stärke

0
Vorintegrierte Modelle
DeepSeek, GLM, Qwen, Kimi, GPT-4.1, Claude, Gemini und weitere weltweit führende LLMs mit einem Klick zugänglich, dynamische Modell-Spiegel-Updates, neue Modelle sofort angepasst, API einsatzbereit
0
Inferenzlatenz-Reduktion
自研推理加速引擎,KV Cache深度优化与Continuous Batching,首Token延迟降低70%,无损精度动态量化,推理计算量减少60-80%
0
Durchsatzsteigerung
异构算力弹性调度,单卡Token产出深度优化,同等算力下Durchsatzsteigerung3至5倍,GPU集群利用率提升300%
0
Chip-Architektur-Support
Gleichzeitige Unterstützung von NVIDIA A100/H100, Huawei Ascend 910B, Muxi GPU, Moore Threads GPU, Multi-Architektur-Einheitsverwaltung und intelligente Planung, Vermeidung von Single-Vendor-Lock-in
0
Service-Verfügbarkeits-SLA
Enterprise-SLA-Zusage von 99,9% Verfügbarkeit, Multi-AZ-Bereitstellung, automatisches Failover und Fallback-Degradation, 7x24 technischer Support gewährleistet Geschäftskontinuität
0
Inhaltssicherheitserkennung
Bidirektionale Desensibilisierung实时过滤隐私风险,Inhaltssicherheitserkennung准确率超99%,联动敏感内容拦截与Audit-Logs,数据泄露风险降低99%
0
Schnellstart
可视化配置界面,3分钟内完成操作,30+开箱即用预置模板,OpenAI-kompatible Schnittstelle,无需深厚技术背景即可跨场景调用
0
Reservierte-Instanzen-Lieferung
Standard reservierte Instanzen innerhalb von 1-7 Werktagen bereitgestellt, Plattform übernimmt Modellbereitstellung und Leistungsverifikation, Inferenzleistungs-Tuning-Support, Gewährleistung stabilen Business-Onboardings
Häufig gestellte Fragen

Häufig gestellte Fragen

Wie stark ist die technische Leistung der AI-Infrastruktur von KHB?
KHB verfügt über eigenentwickelte AI-Rechenbetriebs- und Inferenzbeschleunigungs-Engines mit Kerntechnischen Fähigkeiten einschließlich heterogenem Compute-Einheitsmanagement, Hochleistungs-Modellbereitstellung und intelligentem Routing-Scheduling. Wir haben Hunderte von Enterprise-Kunden in Finanz-, Fertigungs-, Gesundheitswesen und anderen Branchen bedient und bieten Vollketten-AI-Infrastrukturdienste von Rechenressourcen bis Anwendungsbereitstellung.
Was ist der Unterschied zwischen reservierten Instanzen und Pay-as-you-go?
Reservierte Instanzen sind dedizierte Rechenressourcen, die nicht mit anderen geteilt werden, Modellpräzision und Inferenzstabilität sichernd, geeignet für Produktions-Workloads mit strengen Latenz- und Verfügbarkeitsanforderungen. Pay-as-you-go nutzt gemeinsam genutzte Ressourcenpools, die nach tatsächlicher Nutzung abgerechnet werden, geeignet für Entwicklung/Testing und elastische Geschäftsszenarien. Langfristige stabile Nutzung reservierter Instanzen ist kosteneffizienter.
Welche inländischen Chips werden unterstützt?
Aktuell werden Huawei Ascend 910B, Muxi GPU, Moore Threads GPU und weitere inländische Chip-Architekturen sowie NVIDIA A100/H100 und weitere international führende GPUs unterstützt. Durch heterogenes Compute-Einheitsmanagement können Unternehmen flexibel Chip-Lösungen wählen und Single-Vendor-Lock-in vermeiden.
Wie stellt das AI-Gateway Datensicherheit sicher?
AI网关支持Private Deployment,所有数据在企业内网流转,不经过公网。提供数据脱敏、访问控制、全链路加密传输、操作Audit-Logs等企业级安全能力,满足金融、医疗等行业的合规要求。
MaaS平台支持Private Deployment吗?
支持。MaaS平台提供公有云SaaS和Private Deployment两种模式。Private Deployment可将完整平台部署在企业数据中心,数据完全不出域,适合对数据安全有严格要求的行业客户。
Wie starte ich mit den Diensten von KHB?
Sie können uns über die Kontaktinformationen am Ende der Seite kontaktieren. Unser Lösungsteam wird basierend auf Ihren Geschäftsanforderungen maßgeschneiderte Vorschläge erstellen. Von Anforderungsbesprechung, Lösungsdesign, Umgebungsbereitstellung bis Wartung bieten wir professionelle Unterstützung im gesamten Prozess.
Warum benötigen Unternehmen ein AI-Gateway, wenn sie bereits LLM-APIs haben?
Wenn Unternehmen mehrere LLMs einführen, tauchen schnell häufige Probleme auf: Diverse Modellquellen führen zu inkonsistenten API-Protokollen, verteilte Aufrufketten mangels einheitlicher Verwaltung, unterschiedliche Anwendungen haben unterschiedliche SLA-Anforderungen, die ganzheitlich schwer zu erfüllen sind, und Nutzungsvolumen und Kosten sind schwer zu messen. Das AI-Gateway löst diese Probleme zentral und bietet einheitlichen Zugang, intelligentes Routing, feinkörnige Governance und Vollketten-Observabilität.
Fügt das AI-Gateway Netzwerk-Overhead hinzu?
Das AI-Gateway verwendet eine Hochleistungs-Proxy-Architektur mit zusätzlicher Latenz typischerweise innerhalb von 1-3ms, was im Vergleich zur LLM-Inferenzlatenz selbst (Hunderte von Millisekunden bis Sekunden) vernachlässigbar ist. Gleichzeitig können das intelligente Routing und die Verbindungspool-Optimierung des Gateways die Gesamtlatenz tatsächlich reduzieren.
Wie kontrolliert man LLM-Nutzungskosten über das Gateway?
Das Gateway unterstützt die Konfiguration von Traffic-Quoten und Ratenbegrenzungsrichtlinien nach Benutzer, API-Key, Projekt, Organisation und anderen Dimensionen, bietet Vollketten-Kostentransparenz und genaue Abrechnung und hilft Unternehmen, LLM-Nutzungskosten in Echtzeit zu überwachen und Budgetüberschreitungen zu vermeiden.
Wann sollte ein Unternehmen eine private MaaS-Plattform bereitstellen?
Unternehmen sollten in Betracht ziehen, wenn: 1) Geschäft sensible Daten mit strengen Datensouveränitätsanforderungen involviert; 2) KI-Fähigkeiten großflächig in zahlreichen Szenarien mit extrem hohen Inferenzleistungs- und Stabilitätsanforderungen bereitgestellt werden müssen; 3) Diverse inländische oder heterogene Compute-Umgebungen einheitliches Management und effiziente Nutzung erfordern; 4) KI-Technologieentwicklung verfolgt werden soll, aber das Engineering-Team für kontinuierliche Modelladaption und -optimierung fehlt.
Wie sind KHBs internationale AI- und inländische AI-Dienste aufgeteilt und angewendet?
I. Aufteilung der Service-Entitäten
KHB INC (US-Gesellschaft): Bietet AI-Modell-API-Dienste aller Kategorien für Übersee, ausschließlich für Übersee-Unternehmen und -Personen mit Übersee-Identität. Zugangsvoraussetzungen: vollständige Qualifikationszertifizierung, unterstützt USD-Kreditkarte, USD und USDT-Abrechnung. Dieser Service ist auf Übersee-Szenarien beschränkt und darf nicht unsachgemäß inländisch übertragen werden.
Hangzhou Kaihabesi Ecological Technology Co., Ltd.: Betreibt hauptsächlich inländische konforme LLM-Proxy-API-Dienste, alle Daten inländisch verarbeitet, strikte Einhaltung aller inländischen Gesetze und Vorschriften.

II. Rechte, Pflichten & Compliance-Erklärung
Die beiden Entitäten operieren unabhängig, jede trägt die rechtliche Verantwortung für ihre jeweiligen Dienste, ohne Gesamthaftung.
Aktivitäten im Zusammenhang mit Übersee-AI-Diensten folgen lokalen Vorschriften. Benutzer ist es strengstens untersagt, Übersee-Schnittstellen zur Erbringung von Diensten im Inland zu nutzen oder inländische Daten unsachgemäß zu übertragen. Zuwiderhandlungen erfolgen auf eigenes Risiko.
Inländische Dienste dürfen in illegalen oder nicht-konformen Szenarien nicht genutzt werden. Benutzer müssen nationale regulatorische Anforderungen einhalten.
Die Plattform behält sich das Recht vor, Nutzungsqualifikationen zu überprüfen und kann Dienste für nicht-konforme Konten aussetzen oder beenden.

KHB INC
Hangzhou Kaihabesi Ecological Technology Co., Ltd.
Starten Sie Ihre AI-Infrastruktur

Ob Sie KI zum ersten Mal erkunden oder Rechenleistungs- und Modelldienst-Upgrades suchen, KHB bietet professionelle Lösungen

Starten LAUNCH
Geschäftsanfrage: ai@khb.hk