千阶智能千阶实时语音
QIANJIE REALTIME VOICE ENGINE

千阶实时语音智能引擎
自然、低延迟、可控制

面向专业语音机器人的底层 S2S 服务。提供实时打断、智能抢话、大模型加速、智能助手快速识别、意图判断、决策编排、企业知识加载和话术级控制能力。

9分钱/分钟实时打断智能抢话模型加速智能助手识别意图与决策引擎400B+ 模型企业 RAG
实时语音会话真实 S2S 体验
点击开始,通话中可随时挂断当前音色:加载中…
REALTIME INTERACTION

让语音交互真正接近真人节奏

声音像真人只是基础。千阶从发言权、打断响应和推理链路三个层面解决传统机器人的交互问题。

01实时打断模型

识别用户有效开口,快速停止播放和当前生成,并在保留上下文的情况下重新进入理解与决策。

  • 有效语音与噪声区分
  • 播放状态实时同步
  • 打断后上下文续接
02智能抢话模型

理解停顿、换气和犹豫,判断用户是否真正结束表达,减少机器人提前开口和双方重叠说话。

  • 语义结束判断
  • 动态等待时间
  • 发言权智能控制
03大模型加速能力

加速上下文、知识检索和流式生成链路,让 400B+ 大尺寸模型也能用于低延迟实时语音。

  • 首字响应加速
  • 长上下文处理优化
  • RAG 与推理协同
INVALID CALL CONTROL

快速识别智能助手
减少无效通话时长

国内大量电话会被手机智能助手、防骚扰助手、自动应答或语音信箱接听。千阶结合语义和交互特征快速识别,并向上层应用输出可配置的结束决策。

快速识别智能助手与自动应答
事件输出VOICE_ASSISTANT
策略可配立即结束或交由上层
1
电话接通实时分析对方开场和交互特征
监听
2
智能助手识别识别代接助手、自动应答、语音信箱
命中
3
决策输出按配置结束,或将事件交由上层应用处理
结束信号
COGNITION & CONTROL

理解、判断和控制全部开放

既具备大尺寸端到端模型的自然对话能力,也保留专业语音应用需要的意图、决策和话术级控制。

A自研意图引擎

识别客户真实诉求、拒绝原因、状态变化和企业自定义意图。

B自研决策引擎

综合意图、阶段、知识和业务规则,输出下一步对话动作。

C400B+ 模型挂载

接入大尺寸模型,为复杂理解、多轮推理和专业回答提供能力。

D话术级控制

支持脚本节点、意图跳转、阶段推进和异常结束决策。

千阶提供底层语音、认知、知识和控制能力;上层应用决定具体业务流程与业务结果。
COST & CAPABILITY

同等真人化体验,更低的实时语音成本

千阶按分钟计费,避免输出音频 Token 成为主要成本;同时保留大模型、当轮 RAG 和话术级控制能力。

千阶 S2S 标准价格
¥0.09/ 分钟

以约 2,000 Token 的系统 Prompt 为参考口径

按外呼平均通话 18秒 计算:
0.09 × 18 ÷ 60 = 0.027元,即每通约 2.7分钱。
约 ¥0.35–0.50 / 分钟18秒通话约 ¥0.105–0.15 / 通
对比项千阶实时语音某端到端实时语音大模型 3.0
综合价格✓0.09元/分钟,约为友商估算成本的 1/4按音频和文本 Token 后付费,估算约0.35–0.50元/分钟,主要成本来自输出音频
真人效果✓真人化效果基本对齐大尺寸端到端语音交互效果
对话畅通度✓支持打断、抢话控制和低延迟回复,体验基本对齐支持原生端到端对话
本轮 RAG✓提供300–800ms自定义窗口,可在当前轮加载知识当前接口能力下通常需要中途更新或等待下一轮生效
模型能力✓默认400B级模型,可按需挂载GPT、GLM等模型约12B级端到端模型,复杂逻辑推理能力受模型尺寸限制
话术控制✓脚本节点、意图跳转、阶段推进和通用决策引擎自然对话优先,复杂话术级流程控制能力有限
适用方向专业外呼、催收、销售能力复刻、知识高准召客服等复杂场景更适合流程较简单的实时语音和外呼场景
LLM 首 Token 加速

让400B级模型获得接近小尺寸模型的首字响应速度。

独立训练的打断模型

基于千阶历史数百万通实际电话样本训练和持续优化。

自定义 RAG 窗口

提供300–800ms可配置窗口,在本轮完成知识检索和加载。

免费高质量向量

提供免费向量服务,目标检索延迟控制在10ms以内。

专家方法论脚本

提供呼出B2C、呼出B2B、呼入B2B及加微等参考流程。

音色与通用决策

默认100个真人音色,并支持智能助手、辱骂致歉、意图结束等决策。

查看某友商 Token 计费明细与测算依据
输入·文本10元/百万Token
输入·音频80元/百万Token
输入·文本 cached5元/百万Token
输入·音频 cached5元/百万Token
输出·文本80元/百万Token
输出·音频300元/百万Token

折算口径:输入每秒音频约6.25 Token,输出每秒音频约25 Token;System Prompt及重复上下文命中缓存后按cached价格计费。资料所述限制为QPM 60、TPM 100,000。友商产品资料口径注明API处于邀测阶段、预期2026年7月中下旬公测,实际价格、模型参数、限制和能力以友商最新官方信息为准;0.35–0.50元/分钟为按典型对话与约2,000 Token Prompt做出的估算,并非友商固定分钟单价。

ENGINE PIPELINE

一条可观察、可配置的实时链路

每层能力既能独立使用,也能组合为完整的专业语音机器人底座。

实时音频音频输入与状态同步
打断与抢话判断发言权和有效打断
意图引擎理解用户状态与诉求
知识检索意图、问答与企业 RAG
决策引擎话术、阶段与结束策略
模型加速400B+ 模型流式生成
语音输出真人化低延迟回复
KNOWLEDGE LOADING

加载企业意图与问答知识

无需重新训练基础模型。企业表达、标准答案和业务资料更新后即可用于实时对话。

意图知识加载

定义企业特有意图、典型说法和处理规则,让机器人知道用户真正想做什么。

意图:价格异议
"太贵了" · "别人家更便宜" · "还能优惠吗?"

命中动作:进入指定话术节点或输出上层事件
相似表达关键词规则向量匹配意图跳转

问答知识加载

加载标准问答、产品知识和行业资料,通过企业 RAG 为模型提供准确上下文。

标准问题:支持分期付款吗?
相似问法自动召回同一知识,并结合当前话术阶段组织自然回复。

知识范围:企业问答、产品资料、行业知识
批量导入TopK 召回租户隔离实时生效
EXPERT SCRIPTS

可复用的专业场景脚本

脚本是可配置的参考实现,为上层应用提供节点、阶段、意图跳转和异常处理能力。

B2C SCRIPT

B2C 销售对话脚本

包含开场、需求了解、异议处理、信息确认与结束节点,可按业务调整。

B2B SCRIPT

B2B 销售对话脚本

支持企业需求、角色确认、产品介绍、后续安排等多阶段对话控制。

SERVICE SCRIPT

智能客服对话脚本

结合问答知识、业务流程、异常识别和转接策略构建专业服务流程。

还可配置智能助手、辱骂、告别、忙碌、沉默等识别与结束策略。是否结束会话由上层应用控制。
DEVELOPER ACCESS

将底层实时语音能力
接入你的应用

通过 API Key 和基础 SDK 接入千阶 S2S。你可以组合音色、模型、知识库、意图、决策和专家脚本。

# WebSocket
wss://your-domain/developer/realtime?api_key=sk-qj-...

# Authorization
Bearer sk-qj-...

# 基础能力
interrupt · turn-taking · intent · decision · RAG

构建自然、快速、可控的专业语音机器人

从千阶 S2S 体验开始,按需组合底层能力。

立即体验