Which package(s) does this touch?
@traceai/fi-core (TypeScript)
What problem does this solve?
traceAI 目前能够捕获 LLM 调用、工具调用、检索步骤等 OpenTelemetry 追踪数据,并支持通过规则型评估器(如 faithfulness、context retention)进行单次调用的质量评估。
但是,当 Agent 执行多轮对话或长链推理时,开发者无法回答一个关键问题:Agent 在跨轮次对话中,其“场域健康度”是否仍然稳定? 是否存在逻辑一致性下降、矛盾积累、或和谐度持续走低的情况?
目前的评估器只能回答“这次调用是否准确”,无法回答“这个 Agent 在 10 轮对话后是否仍然健康”。
U/D/A/H 场域诊断框架专门解决这个问题:通过追踪跨轮次的统一性(U)、对抗性(A)、和谐度(H)的演化轨迹,提供 Agent 场域健康度的早期预警。
Proposed solution
将 U/D/A/H 场域诊断框架集成到 traceAI 中,使 traceAI 捕获的 OpenTelemetry 追踪数据能够自动生成四维场域健康度轨迹(U/D/A/H)。
API 草图:
# 伪代码:U/D/A/H 诊断层 API 草图
class FieldDiagnostics:
def __init__(self, trace_data: dict):
self.traces = trace_data # OpenTelemetry 格式 JSON
def extract_dialogue(self) -> str:
"""从 trace 中提取 prompts + completions 拼接为连续文本"""
pass
def compute_trajectory(self, step_size: int = 100) -> list:
"""以固定步长计算 U/D/A/H 四维轨迹"""
pass
def diagnose(self) -> dict:
"""返回完整的诊断报告:U/D/A/H 轨迹 + 翻转点 + 驱动维度分析"""
return {
"trajectory": [], # U/D/A/H 四维时间序列
"flip_points": [], # 场域相变候选位置
"driver_distribution": {}, # U/D/A/H 驱动占比
"range_summary": {} # 各维度值域范围
}
# 使用示例
diagnosis = FieldDiagnostics(trace_data)
report = diagnosis.diagnose() # 输出 CSV 和 HTML 报告
集成路径:
traceAI 输出 OpenTelemetry 格式 JSON 追踪数据
提取 llm.prompts + llm.completions + token_usage
以 100 字符为步长逐段计算 U/D/A/H 四维值
输出 CSV 轨迹 + 结构化诊断报告 + HTML 可视化报告
已在本 Issue 中上传完整验证报告:traceAI_report_multidim_report.html(可直接查看)
验证结果证明:该方案与 traceAI 的数据格式完全兼容,模拟数据端到端链路已跑通。
---
### Alternatives considered
```markdown
1. **直接使用 traceAI 现有规则型评估器**(faithfulness、context retention)间接推断场域状态 —— 但规则型评估器只能判断单次调用的质量,无法追踪跨轮次的场域演化趋势,也无法回答“Agent 是否在退化”这个问题。
2. **使用通用可观测性工具(如 Datadog、Jaeger)展示 trace 数据** —— 这类工具提供调用链可视化,但不提供“场域健康度”这一诊断维度,开发者仍然需要自己判断数据背后的意义。
3. **本次验证的 U/D/A/H 方案**是专门针对“跨轮次场域健康度”设计的,填补了上述两种方案的盲区。验证结果证明该方案与 traceAI 的数据格式完全兼容,且能输出可读的诊断报告。
### Are you willing to open a PR?
Yes — I'd like to implement this
### Anything else?
本提案基于 DeepSeek-V3 社区 #1466 跨框架验证项目,U/D/A/H 框架已在合同文本审计场景中与 TAT-7、Cophy、HeartFlow 等独立框架完成交叉验证(r=0.985 相关性、0.3 阈值收敛、5 翻转点重合)。
本次 traceAI 集成验证使用了模拟追踪数据,证明端到端链路已跑通。下一步可以用真实 trace 数据进行复现验证。
相关资源:
- #1466 跨框架验证报告:[链接]
- GitHub 仓库:[luoxuejian000/thinkcheck-agent-v10](https://github.com/luoxuejian000/thinkcheck-agent-v10)
- 本 Issue 附件:
<!-- Failed to upload "traceAI_report_multidim_report.html" -->
Which package(s) does this touch?
@traceai/fi-core (TypeScript)
What problem does this solve?
traceAI 目前能够捕获 LLM 调用、工具调用、检索步骤等 OpenTelemetry 追踪数据,并支持通过规则型评估器(如 faithfulness、context retention)进行单次调用的质量评估。
但是,当 Agent 执行多轮对话或长链推理时,开发者无法回答一个关键问题:Agent 在跨轮次对话中,其“场域健康度”是否仍然稳定? 是否存在逻辑一致性下降、矛盾积累、或和谐度持续走低的情况?
目前的评估器只能回答“这次调用是否准确”,无法回答“这个 Agent 在 10 轮对话后是否仍然健康”。
U/D/A/H 场域诊断框架专门解决这个问题:通过追踪跨轮次的统一性(U)、对抗性(A)、和谐度(H)的演化轨迹,提供 Agent 场域健康度的早期预警。
Proposed solution
将 U/D/A/H 场域诊断框架集成到 traceAI 中,使 traceAI 捕获的 OpenTelemetry 追踪数据能够自动生成四维场域健康度轨迹(U/D/A/H)。
API 草图: