音视频实时决策 Lab所有实验 ↗
05 / VOICE AGENT

听见停顿,也听懂未完待续。

VAD 判断「有没有在说话」,Clef Omni 判断「有没有说完」。

连接未启动WebSocket · clef-omni
01本地 VAD语音 / 停顿
→
02Clef Omni音频直接判断 · 单次请求
→
03轮次策略继续等 / 回应 / 工具
→
04可打断回应演示模板 · 模拟工具
LIVE SESSION尚未开始
Ⅱ
准备好听你说

打开麦克风,或用内置语音体验真实 VAD → 模型判断。

语音概率 —尚无语音片段

开麦后,VAD 在本机运行;停顿切片才发送到 Cloudflare。不保存录音。建议戴耳机体验插话。

不开麦,也能体验

真实合成音频 · 同一条 VAD 链路

示例文字只用于展示;模型收到的是音频,不包含示例答案。

对话记录

录音无转写 · 不引入 ASR

你的语音片段、模型交接与演示回复会显示在这里。

这一次,模型怎么判断?

等待输入
语义完整度—
65%

声学停顿不等于语义完成。

轮次状态

完整 / 未完 / 附和 / 噪声

表达语气 —

是否需要工具

—

工具路由

—

语义完整与参数齐全分别判断。

VAD 静音窗口300 ms
模型推理—
提交至结果—
静音起至结果—
查看本次原始判断
尚无数据

状态轨迹

真实事件 · 最近 30 条
  1. 开始后观察状态如何轮转。
文字对照测试(不经过 VAD)

仅比较语义决策;不计入音频链路测试。

看懂这次实验

Clef Omni 一次返回语义完整度、轮次状态、表达语气、工具需求、路由概率和待补充信息。低于阈值继续等;完整才回应或进入模拟工具。回复为预设模板,工具不执行外部操作。插话会中断回应状态,并使上一轮未完成的判断失效。

模型卡 ↗