Algorithm Workbench

评估算法工作台

v2026.09.10.1本页帮助
语言
主题
API

正在验证平台访问权限…

Future Training Capability

训练能力

[准备中]
01

未来解决的问题

人工规则和零散实验无法从大量合格样本中稳定学习数据与目标结果的关系,也难以复现某个模型究竟如何产生。

02

为什么有必要建设

当授权数据、研究协议和专家标签齐备后,需要标准训练流水线冻结数据身份、参数、代码、指标和模型产物。

03

预期价值

可重复地产生候选模型,通过验证集和锁定测试量化泛化能力,并降低研究、调参和发布过程中的数据泄漏与不可追溯风险。

当前阶段当前仅开放工程准备、状态查看和治理记录;正式模型训练、自动 Shadow 和生产模型部署仍保持暂停。日常报告继续使用 stable RulePack。

Stage D Training Lifecycle

模型训练与资产登记

使用通过全部训练门禁的冻结数据集训练可重复 baseline。任务保存数据集、验证和标注哈希;ONNX 产物必须通过运行时检查后才会自动登记为 experimental 模型资产。

当前 baseline 用于验证训练、评估和发布链,不用于替代规则算法。固定置信度仍是临时值,必须在真实验证后校准。

训练任务

0

选择训练任务查看审计和评估结果

Stage D Locked-Test Evaluation

锁定测试集评估与候选发布门禁

测试集只允许在模型版本冻结后评估一次。系统保存数据、标签、Feature、模型哈希、逐样本预测、95% 置信区间、亚组结果和门禁结论。

评估通过仍不等于临床有效。模型还必须完成科学审阅,才能从 experimental 晋级 candidate;进入 augment 或 replace 需要后续 Shadow 和外部验证。

评估记录

0

选择评估记录查看指标、门禁和科学审阅。

Stage D Candidate Shadow Release

Candidate Shadow 发布决策与 augment 资格

将 candidate 模型在训练受试者之外的批量 Shadow 证据汇总为模型级发布决策,检查独立受试者、预测覆盖、失败、fallback、规则差异、质量、置信度和专家审阅。

晋级 stable 只表示模型资产具备受控 augment 资格,不会自动修改 RulePack。启用 augment 仍需创建新 RulePack 草稿、限制灰度范围并通过完整规则发布门禁。

Shadow 证据批次

发布决策

0

选择发布决策查看证据、指标、门禁和委员会审阅。