问题识别能力
召回率看该找的问题找全多少,精确率看报出的问题有多少成立。F1要求两者同时表现良好。
用统一合同、统一立场和统一算法,回答三个真正重要的问题:找得全不全、报得准不准、建议能不能用。
i 首组基准将由平台组织专家审定;第2、3组待后续专家共同建设。
F1与建议有效覆盖率共同计分,法律红线单独核验。
总分衡量“发现问题”和“解决问题”的综合表现;法律红线挡住不能被平均分掩盖的严重错误。
召回率看该找的问题找全多少,精确率看报出的问题有多少成立。F1要求两者同时表现良好。
专家只判断建议是“可以采用”“需要实质修改”还是“不可用”,对应系数1、0.5、0。
严重违法、审查立场颠倒或引入重大风险,不允许被其他高分抵消,并必须经过专家复核。
机器完成结构化处理,关键判断由法务或律师复核。
一键下载已开放组的10份合同,并按固定审查立场测试参评产品。
一次上传10份审查报告,后台自动识别并检查与基准合同的一一对应关系。
拆分审查意见,匹配标准问题项,计算召回率、精确率、F1和建议覆盖率。
展示分数、遗漏、误报、有效新增和法律红线;正式结果进入专家复核。
面向不同合同领域招募有实务经验的律师和法务,共同审定基准合同的标准问题项,并对有争议的评测结果进行校正。
核对合同立场、标准问题项、风险等级和建议方向。
复核疑难匹配、有效新增、误报和法律安全红线。
对参评方提出的异议给出独立、可记录的专业意见。
发现基准缺陷时提出修订,新旧版本分别留存、可复核。
委员席位暂时保留。正式名单只在本人确认、完成利益冲突披露并实际参与基准审定后发布;欢迎有一线合同经验的律师、法务和研究者报名。
施工、代建、征地拆迁
股权转让、投资合作、融资
SaaS、数据服务、AI项目
货物采购、运输、渠道合作
欢迎具有稳定合同审查经验、熟悉特定业务领域,并愿意遵守独立评审和利益冲突回避规则的律师或法务申报。

一个软件评测项目最多包含三组任务。目前先开放完成专家审定的分组,后续两组审定完成后逐步加入。
每一个分数都能回到具体合同、具体问题和具体判断。示例数据仅用于展示报告结构。
法律安全状态:通过复核未发现未解决的重大法律红线。数值总分不能替代安全结论。
67个标准问题中,命中分合计56.3。
误报会进入分母,重复意见也会增加筛选负担。
单独展示,不进入主分,也不降低精确率。
逐项披露错误判断、重复意见和立场冲突。
评测提供的是特定基准、特定版本和统一条件下的比较结果,不是对产品全部能力的最终判定,也不能替代采购方在自身业务中的试用与专业判断。
合同类型、样本数量、难度分布和参考答案质量都会影响分数。当前结果只代表本版本基准覆盖的范围,不能自然推及所有行业、合同类型和法律问题。
真实审查还会受到交易目的、谈判地位、企业制度、历史沟通和商业取舍影响。当前评测以固定合同和固定审查立场为主,不能完整还原企业法务的全部决策环境。
语义匹配和部分质量判断由大模型辅助完成,在隐含风险、立场取舍和建议可用性上可能与人类专家存在偏差。争议项、法律红线和正式排名需要专家复核。
模型、规则库、参数和产品版本变化都可能改变结果。当前主要评价最终审查报告,不评价速度、成本、系统集成、交互体验和产品内部的工作过程。
同一基准、同一输入、原始输出封存、尽量盲评、利益冲突回避、人工修改留痕。公开排名只接受完成统一测试并经过复核的正式评测。
查看方法与治理规则 →