-
合法收集机器学习数据:目的限定、许可、同意与可追溯流程
数据并非越多越好,也不是公开可见就能任意训练。本文从目的与最小化出发,比较开放数据、内部记录、合作采购和参与者招募,并设计许可、同意、删除和血缘记录。
-
从二维散点到一条可验算的分类边界
二维对数几率回归把每个样本映射为概率,再用线性方程画出类别分界。完整实验不止是调用优化函数:还要核对偏置列、交叉熵与梯度、边界方程、收敛轨迹以及数据外区域的解释范围。
-
同一横坐标出现两个标签时,概率曲线在表达什么
一维二分类数据可以用S形曲线展示参数、概率与阈值的关系;若相同x同时对应零和一,模型不可能靠移动一条边界消除冲突。这个小实验因此特别适合区分拟合、分类、校准与数据可分性。
-
线性回归不只是画直线:残差、区间估计与外推风险
最小二乘能快速拟合连续目标,但系数含义、残差结构、预测区间与样本范围决定结果能否解释。本文用能耗示例建立完整回归诊断。
-
机器学习如何进入真实工作流:八类任务、人工节点与回退机制
机器学习的应用价值来自改变一个具体工作步骤,而不是模型单独存在。本文按排序、预测、检测、文档、感知、生成与控制梳理,并为每类输出配置人工和回退。
-
机器学习项目的四份契约:目标、数据、损失与反馈
机器学习不是模型名词的集合,而是四份契约能否对齐:预测什么、从谁的数据学习、怎样计算错误,以及结果进入流程后如何反馈。