JinkelaCrops

APPLIED ML / RESEARCH & ENGINEERING

让研究想法,成为可验证的系统。

关注因果学习、结构化知识与可靠智能体。把复杂问题拆成清晰的假设、可复现的实验,以及能够被检验的工具。

项目与研究

PROJECTS & RESEARCH

以下为拟议的公开版边界,不代表已经发布。只展示可独立复现的通用方法,不包含专有数据或业务系统。

01

causal-eval-lab

可信的因果模型评估

评估处理效应的排序与估计质量;把数据切分、重叠性诊断和指标定义作为实验的一部分。

公开版规划
UPLIFT · CROSS-FITTING · SYNTHETIC DGP
查看拟议范围

首版:独立评估器、指标测试、合成真值与固定数据划分。多目标模型、通用 DGP 和局部残差校正先作为实验模块;没有可复现证据时,不声明优于基线。

研究笔记选题 · 拟写

当 AUUC 指标彼此矛盾时,我们究竟在比较什么?

拟写内容:区分目标人群、估计量、随机基线和归一化口径;以可计算的小例子说明不应直接横比不同评估协议。此处为选题摘要,尚非已发表文章。

02

soft-knowledge-lab

从知识到可检验的增益

研究事实、决策逻辑和约束如何被检索、组合与验证,以及有限预算下的知识选择。

公开版规划
KNOWLEDGE ROUTING · EVALUATION · DSL
查看拟议范围

首版:开放任务、可授权知识集合、无知识/随机/检索/学习路由基线,以及成本和稳定性报告。LLM→DSL 保留为研究模块,不把输出一致性等同于推理过程忠实。

研究笔记选题 · 拟写

知识很丰富,为什么只应该给模型一小部分?

拟写内容:知识冗余、冲突与选择成本;比较预算相同的检索、规则和学习路由,而非仅比较上下文长度。此处为选题摘要。

03

agent-review-loop

有边界的生成与审计

分离生成、审查与执行,把停止条件、实验记录和验证证据变成可检查的工程接口。

公开版规划
REVIEW · TESTS · BUDGETED ITERATION
查看拟议范围

首版:离线 mock 演示、确定性测试、受限迭代、停滞退出与审计日志。默认不注册用户级 Hook,不运行外部训练,不自动发送消息。

研究笔记选题 · 拟写

审查智能体不能只给分:从反馈走向可验证证据

拟写内容:独立性边界、测试契约、失败保留和预算停止;展示怎样区分通过测试与证明科学结论。此处为选题摘要。

关于

我的研究兴趣位于机器学习、因果推断与知识系统的交叉处。相比堆叠模型,更关心问题定义、实验边界,以及结果是否能够被他人重复验证。

这里记录通用方法与公开实验的探索。具体项目的实现、许可证和验证状态,以正式公开的仓库为准。

早期公开代码

word-cloud ↗第三方工具扩展
dag_test ↗第三方方法实验

保留学习路径,不作为当前成熟度或原创成果的证明;尚未重新复现。