Skip to content

Latest commit

 

History

History
62 lines (39 loc) · 2.91 KB

File metadata and controls

62 lines (39 loc) · 2.91 KB

CoSMiT 实验设计

研究对象

首轮只选择 TensorFlow 和 PyTorch,分别运行 TensorFlow→PyTorch 与 PyTorch→TensorFlow。组件按损失函数、张量算子、神经网络层三类分层抽样,每类、每个方向选择 10-20 个目标组件。

版本、提交号、Python、编译器、CPU/GPU、驱动和依赖均写入运行 manifest。源测试必须先在固定环境连续运行至少三次并通过,才进入迁移。

金标准

两名评审者独立标注:组件关键性、源/目标组件对应关系、测试意图、核心输入、核心断言和最终迁移有效性;分歧由第三人仲裁。报告 Cohen's kappa 或 Krippendorff's alpha。

RQ 与指标

RQ1:关键组件识别

  • 基线:随机、使用频率、覆盖缺口单因子。
  • 指标:Precision@K、NDCG@K、被选组件的人工缺口评分、后续有效测试/缺陷产出。

RQ2:相似组件检索

  • 基线:名称相似、文档 embedding、参数签名、均匀融合。
  • 指标:Recall@K、MRR、Top-1 accuracy、一对多映射召回率。
  • 消融:分别移除名称、文档、参数、源码、调用上下文和测试行为。

RQ3:测试知识与迁移

  • 基线:API 替换、整段 LLM 翻译、无显式意图的结构化翻译。
  • 指标:语法通过率、初次执行率、最终有效率、意图保持率、oracle 完整率、人工修改量。

RQ4:验证与修复

  • 消融:无静态检查、无反馈修复、1/2/3 轮修复。
  • 指标:修复成功率、每轮边际收益、错误类别分布、token/时间/GPU 成本、过度修复率。

RQ5:测试增强效果

  • 指标:分支/行覆盖增益、shape/dtype/device/gradient/异常覆盖增益、变异杀伤率、有效缺陷数、误报率。
  • 扩展效果必须与仅迁移不扩展版本比较。

有效迁移判定

一个测试只有同时满足以下条件才计为有效:

  1. 在声明环境中可重复执行;
  2. 调用预期目标组件;
  3. 保留源测试的核心输入、核心执行和核心断言;
  4. 差分或独立 oracle 可解释;
  5. 未通过删除断言、固定输出、放宽到无意义阈值等方式“通过”;
  6. 对目标组件产生可测量覆盖或行为增益。

统计与报告

比例指标报告置信区间;成对结果使用 McNemar 检验,连续成本/覆盖指标根据分布选择配对 t 检验或 Wilcoxon 符号秩检验,并报告效应量。所有失败样本保留到公开 artifact,不只报告成功样本。

威胁控制

  • 框架/组件代表性:分层抽样并报告未覆盖类别。
  • LLM 波动:固定模型版本、prompt、temperature 和随机种子,重复运行。
  • 环境差异:容器化并记录硬件、后端和驱动。
  • oracle 误差:区分预期语义差异、数值噪声和真实缺陷,人工复核缺陷。
  • 数据泄漏:检查模型是否直接见过目标测试;对时间切片和私有回归样本单独报告。