编程感悟 新冠纪元 前端 软件系统设计 心绪 数学与控制 读书与历史 人工智能

函数、老虎机、强化学习优化问题的辨识与区别

柏舟 新冠5年 01-11 阅读次数 559

区别:是否存在先验的模型,奖励函数是否可观测。有无足够的信息决定了最终是否需要平衡搜索、当前收益和未来。

线性泛函分析中向量空间和LQR、对偶空间的物理含义

柏舟 新冠5年 01-05 阅读次数 661

从泛函的向量空间理解LQR,以及对张量的协变、逆变的理解。

毛主席在我心里是个怎样的人

柏舟 新冠4年 12-26 阅读次数 521

在国际象棋上复现AlphaZero的设计和失败的心得

柏舟 新冠4年 12-19 阅读次数 757

AlphaZero是一种以MCTS为基础的使用模仿学习的强化学习方法,适用于奖励函数难以建模的情形。国际象棋动作空间建模很复杂。复现策略拟合还算成功,但是局势判断拟合失败。

新冠纪元的源起和我的哲学体系

柏舟 新冠4年 12-03 阅读次数 623

我的哲学体系解决两个时代问题:人工智能意味着什么?现代文明是什么?

线性代数、数列和微分方程特征值的含义,连续与离散的关系,零空间与稳定性

柏舟 新冠4年 11-30 阅读次数 639

把线性代数、常微分方程、自动控制原理连续起来,简单举了一个物理一个赛博的例子。

从Python、C#、Java谈不可变类型和可变类型的赋值

柏舟 新冠4年 11-27 阅读次数 495

不可变类型(值类型)和可变类型(引用)的赋值行为有很大差异,具体表现在副作用的影响、装箱上。

大雨的夜和纷乱的心

柏舟 新冠4年 11-05 阅读次数 518