Skip to content

[Feature] 集成 ThinkCheck 作为 OpenCompass 的“推理健康度”评估维度 #2475

Description

@luoxuejian000

Describe the feature

问题:OpenCompass 缺少对推理过程“健康度”的量化评估

OpenCompass 在评估模型“正确性”(准确率、F1、BLEU)方面已经非常成熟,但模型可能在答对题目的同时,其推理链中存在概念漂移、逻辑矛盾或论证质量衰减。目前缺少一个与“正确性”完全正交的“推理健康度”评估维度。

我们做了什么

ThinkCheck 是一个基于晶脉哲学四重公理构建的 AI 推理质量评估引擎,通过 U/D/A/H 四维模型对文本进行深层语义诊断:

  • U(统一性):概念在文本中的语义一致性
  • D(发展性):新信息的价值和逻辑流动的连续性
  • A(对抗性):矛盾在关系网络中的累积张力(不是二值分类器)
  • H(和谐度):加权综合评分 H = λᵤ·U + λᴅ·D - λₐ·A

仓库:thinkcheck-agent-v9

社区验证

本工具已在 DeepSeek 社区通过严格技术审查:

  • @icophy 提出的构造效度批评已在 v9 中通过彻底“去词库化”重构解决,他公开表示“I accept the theoretical reframe”
  • @qingkong66 提到将 ThinkCheck 收录进六月度社区文摘
  • @fkyah3 的语言漂移实验与 ThinkCheck 形成互补验证

集成方案

在 OpenCompass 的 Evaluator 基类中增加一个可选的 ThinkCheckEvaluator 子类。当评测配置中启用该评估器时,每次模型输出在被“正确性评估”之前,先经过 ThinkCheck 的 U/D/A/H 四维扫描,结果作为独立的指标列出现在评测报告中。

  • 零侵入:无需修改 OpenCompass 核心评测逻辑
  • 两种接入方式:ThinkCheck 提供 Python SDK 和 RESTful API
  • 完全本地运行:评估过程不调用任何外部 API,数据不出本机
  • 协议兼容:Apache 2.0

关键验证数据

测试案例 U值 D值 A值 H值 说明
纯语义矛盾 0.1667 0.5165 0.2500 0.2233 旧版A=0.0000,现已修复
法律文书矛盾 0.2000 0.7600 0.9991 0.1842 6条矛盾边全部可追溯
e租宝案长文本 0.2567 0.9764 0.9998 0.1076 3000字长文本,63步采样零超时

后续路径

本提案仅作为技术讨论的起点,不附带代码提交。若社区认可此方向,我们可以提供详细的 API 文档和技术支持。代码实现可由我们后续提交 PR,或由社区开发者基于此架构完成。

Will you implement it?

  • I would like to implement this feature and create a PR!

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Labels

No labels
No labels

Type

No type

Projects

No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions