Skip to content

[Proposal] U/D/A/H 场域诊断框架 × traceAI 集成验证 #185

Description

@luoxuejian000

Which package(s) does this touch?

@traceai/fi-core (TypeScript)

What problem does this solve?

traceAI 目前能够捕获 LLM 调用、工具调用、检索步骤等 OpenTelemetry 追踪数据,并支持通过规则型评估器(如 faithfulness、context retention)进行单次调用的质量评估。

但是,当 Agent 执行多轮对话或长链推理时,开发者无法回答一个关键问题:Agent 在跨轮次对话中,其“场域健康度”是否仍然稳定? 是否存在逻辑一致性下降、矛盾积累、或和谐度持续走低的情况?

目前的评估器只能回答“这次调用是否准确”,无法回答“这个 Agent 在 10 轮对话后是否仍然健康”。

U/D/A/H 场域诊断框架专门解决这个问题:通过追踪跨轮次的统一性(U)、对抗性(A)、和谐度(H)的演化轨迹,提供 Agent 场域健康度的早期预警。

Proposed solution

将 U/D/A/H 场域诊断框架集成到 traceAI 中,使 traceAI 捕获的 OpenTelemetry 追踪数据能够自动生成四维场域健康度轨迹(U/D/A/H)。

API 草图:

# 伪代码:U/D/A/H 诊断层 API 草图

class FieldDiagnostics:
    def __init__(self, trace_data: dict):
        self.traces = trace_data  # OpenTelemetry 格式 JSON

    def extract_dialogue(self) -> str:
        """从 trace 中提取 prompts + completions 拼接为连续文本"""
        pass

    def compute_trajectory(self, step_size: int = 100) -> list:
        """以固定步长计算 U/D/A/H 四维轨迹"""
        pass

    def diagnose(self) -> dict:
        """返回完整的诊断报告:U/D/A/H 轨迹 + 翻转点 + 驱动维度分析"""
        return {
            "trajectory": [],      # U/D/A/H 四维时间序列
            "flip_points": [],     # 场域相变候选位置
            "driver_distribution": {},  # U/D/A/H 驱动占比
            "range_summary": {}    # 各维度值域范围
        }

# 使用示例
diagnosis = FieldDiagnostics(trace_data)
report = diagnosis.diagnose()  # 输出 CSV 和 HTML 报告
集成路径traceAI 输出 OpenTelemetry 格式 JSON 追踪数据

提取 llm.prompts + llm.completions + token_usage

 100 字符为步长逐段计算 U/D/A/H 四维值

输出 CSV 轨迹 + 结构化诊断报告 + HTML 可视化报告

已在本 Issue 中上传完整验证报告traceAI_report_multidim_report.html可直接查看验证结果证明该方案与 traceAI 的数据格式完全兼容模拟数据端到端链路已跑通---


### Alternatives considered

```markdown
1. **直接使用 traceAI 现有规则型评估器**faithfulnesscontext retention间接推断场域状态 —— 但规则型评估器只能判断单次调用的质量无法追踪跨轮次的场域演化趋势也无法回答Agent 是否在退化这个问题2. **使用通用可观测性工具 DatadogJaeger展示 trace 数据** —— 这类工具提供调用链可视化但不提供场域健康度这一诊断维度开发者仍然需要自己判断数据背后的意义3. **本次验证的 U/D/A/H 方案**是专门针对跨轮次场域健康度设计的填补了上述两种方案的盲区验证结果证明该方案与 traceAI 的数据格式完全兼容且能输出可读的诊断报告### Are you willing to open a PR?

YesI'd like to implement this

### Anything else?

本提案基于 DeepSeek-V3 社区 #1466 跨框架验证项目,U/D/A/H 框架已在合同文本审计场景中与 TAT-7、Cophy、HeartFlow 等独立框架完成交叉验证(r=0.985 相关性、0.3 阈值收敛、5 翻转点重合)。

本次 traceAI 集成验证使用了模拟追踪数据证明端到端链路已跑通下一步可以用真实 trace 数据进行复现验证相关资源- #1466 跨框架验证报告:[链接]
- GitHub 仓库:[luoxuejian000/thinkcheck-agent-v10](https://github.com/luoxuejian000/thinkcheck-agent-v10)
-  Issue 附件<!-- Failed to upload "traceAI_report_multidim_report.html" -->

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions