代码审查与测试 · 深度资料

minimal-run-and-audit

Minimal Run and Audit 为科研代码执行已选定的冒烟、推理、评估或其他短时非训练验证。

最适合

需要可审计首次运行的研究者

可以得到

执行有界验证、记录审计产物

主要局限

它不选择复现目标、不训练模型、不做广泛论文分析,也不会隐藏改变科学意义的修改。

首要风险

把科学性变更隐藏为搭建修复 对数据、检查点、精度或评估的补丁可能改变结果含义;应记录每项偏差、保留原始命令,并在必要时降低可比性评级。

证据新鲜度

三类检查,分别说明

近期核对过来源,不等于已经运行测试或完成安全审计。

上游来源核对于 2026-08-20

已固定提交 · 3ab50525

打开固定提交
SkillSignal 资料基于来源整理

更新于 2026-08-20

运行与安全尚未独立验证

来源审阅不能证明实际行为或安全性。

30 秒看懂

它能做什么,以及什么时候值得选

Minimal Run and Audit 为科研代码执行已选定的冒烟、推理、评估或其他短时非训练验证。它把结果规范保存到 repro_outputs,记录执行结果、科学性变更、可比性与补丁,并明确标记为 verified、partial 或 blocked,而不是隐藏偏差。

按 Agent 安装

选择你的 Agent

路径来自 Agent 官方文档或 skills.sh 同源通用安装器。兼容状态仍以这个 Skill 的资料为准。

原生支持

该 Skill 的当前资料明确列出了此 Agent。仍应先检查脚本、权限与外部依赖。

项目范围.claude/skills/minimal-run-and-audit/
个人范围~/.claude/skills/minimal-run-and-audit/

项目范围适合团队共享;个人范围适合跨项目复用。安装器默认项目范围,加 -g 可改为个人范围。

安装命令(项目范围)npx skills add lllllllama/rigorpilot-skills --skill minimal-run-and-audit --agent claude-code
Agent 官方文档

Claude Code 会自动发现项目级或个人级的自定义 Skill 目录。

查看路径依据

典型工作流

从任务到结果的典型流程

01

执行有界验证

执行一个已选定的短命令,不扩展为训练。

02

记录审计产物

保存结果、命令、变更、可比性说明与补丁。

03

如实报告状态

区分已验证证据、部分执行与阻塞状态。

优点与局限

优点与使用边界

显著优点

  1. 本页已依据当前上游 SKILL.md 的具体工作流进行人工整理。
  2. 能力边界与来源 lllllllama/rigorpilot-skills 保持明确关联。
  3. 核心用途、局限与风险分开呈现,便于安装前判断。

潜在缺点与局限

  1. 它不选择复现目标、不训练模型、不做广泛论文分析,也不会隐藏改变科学意义的修改。
  2. 一次短运行成功并不能证明完整论文复现、指标一致或生产可靠性。

适合人群

适合哪些人

需要可审计首次运行的研究者

检查可复现证据的审查者

使用前须知

使用前需要检查的风险

把科学性变更隐藏为搭建修复

对数据、检查点、精度或评估的补丁可能改变结果含义;应记录每项偏差、保留原始命令,并在必要时降低可比性评级。

上游指令变化

Skill 行为可能随仓库更新而变化;重要工作流应记录所用提交,并在更新后重新审查。

安全说明

如何理解它的权限

  • 声明权限仍以当前上游 SKILL.md 和运行时请求为准。
  • 仓库文件、网页内容与工具输出都应视为不可信输入。
  • SkillSignal 未独立执行或安全审计该软件包;skills.sh 外部标签不构成 SkillSignal 认证。

这不是安全认证。 第三方评级仅作为标注来源的参考信息展示;SkillSignal 尚未独立执行或安全审查此 Skill。

软件包内容

已收录文件

SKILL.md上游 Skill 说明来源可查

标签

实验运行审计轨迹可复现性

人工扩展资料,依据 lllllllama/rigorpilot-skills 的当前上游 SKILL.md 与标注来源整理,核对日期 2026-08-20。本文为原创摘要,不代表已执行或安全认证。