研究视频 Research Videos
计算与医学研究
看完能讲清计算思维重塑医学研究的三条路径与边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
计算与医学研究
看完能讲清计算思维重塑医学研究的三条路径与边界
医学研究中的计算挑战
上页我们看到计算已经渗透到医学的每个角落。但当一个基因测序仪一天产出20TB数据、医院一天产生上万张影像切片时,挑战的真正面目才浮出水面——海量数据本身成了最难处理的对象。
雨量超过管网容量就会内涝,数据超出算力就只能排队或丢弃
计算工具在医学中的应用
一个医生面前堆着10万张CT影像、一个基因测序仪每天吐出几TB原始碱基——这些'原材料'本身不是知识,必须经过计算工具的层层加工,才能变成可指导决策的发现。
铁矿石不经提炼只是石头,要筛选→熔炼→锻打才能成钢;数据也要这样一步步加工才能成知识
基因组测序的数据分析流程
把FASTQ原始数据一步步加工成可信的变异位点列表,是计算基因组学的核心流水线。
药物研发的计算模拟
从左到右读:先准备靶点与化合物库两层输入,经粗筛到精算两层过滤,最终把 Top 化合物送上实验台。
随机性的本质
上一节药物模拟动辄跑百万次「随机」采样——但你按下回车那一刻,计算机真的在「随机」选吗?这一页拆穿这件事。
真洗牌连洗牌人也无法预测;伪随机是暗中排好的牌序,记下顺序即可复现
伪随机数生成原理
计算机是确定性的机器——给定相同输入,永远吐出相同输出。那临床试验的随机分组、蒙特卡洛模拟的随机抽样,怎么做到「随机」?答案:伪随机数生成器,用确定公式制造看似无规律的数列。
种子如同食材,算法如同菜谱——换食材变菜,但菜谱不变则菜品确定
蒙特卡洛方法
前页我们造出会'扔骰子'的伪随机数——那用这些'数字骰子'能算什么?蒙特卡洛方法给了一个经典答案:扔够多次,答案自己浮现。
落在某区域内的米粒比例,就是该区域面积占比的近似
蒙特卡洛积分的计算步骤
用随机抽样反推定积分,几何上就是把点数比例放大成包围盒里的面积。
随机算法实战演示
用药物浓度曲线演示蒙特卡洛采样与积分估计
高亮行把上一页的"建模—采样—估计"三步翻译成代码:模型是积分对象,种子保证可复现,均匀采样是核心动作,最后两行分别演示"均值×长度"与"样本比例"两种估计。
随机算法vs确定算法
两者都求真值,但路径不同——一个靠采样,一个靠穷举,根本分歧在速度与精度。
- 通过随机采样逼近真值
- 高维问题下速度优势明显
- 结果有统计误差,可控
- 通过确定性推导求精确解
- 高维时遭遇维度灾难
- 结果可复现,无随机误差
机器人系统概述
看完你能亲手拆解机器人从感知到执行的全链路闭环
机器人传感与数据采集
上一页我们看了机器人系统的整体框架。它凭什么知道自己在哪、手臂转了多少?全靠传感器。
眼睛→摄像头、内耳前庭→IMU、皮肤→触觉阵列
机器人控制系统
传感器告诉你「世界长什么样」,接下来该让电机怎么转?这就到了控制系统登场——是机械地按指令执行,还是根据反馈实时修正?这一步决定了机器人在变数面前能不能「临场应变」。
蒙眼只按记忆迈步对应开环;睁眼随时调整对应闭环
运动规划的基本步骤
把机器人从起点送到目标,分四步走:先建地图,再找路,再磨平,最后真跑。
机器人控制代码演示
一个最小可运行的"感知→决策→控制→观测"闭环,机器人沿直线逼近目标。
L7 感知目标、L11 阈值决策、L15/L16 把任意方向归一化后乘速度×时间推进——即运动规划里"沿梯度走"的最小实现。
机器人应用案例
从左到右环境开放程度递增,节点代表机器人在不同领域的典型应用,复杂度随位置提升。
数据库存储架构演进
前面提到机器人、基因组、药物研发都在爆发式产出数据。当数据量从 GB 跨入 TB,传统「一行一个对象」的存储开始吃力——为什么分析查询会越来越慢?
同类商品紧挨摆放=同列值连续存;盘点某品类只需沿货架走一次
列式存储核心原理
行式数据库像一本合订册,每页就是一个人的完整档案;列式存储却把所有人的姓名、年龄、身高分别装进不同抽屉。查询只关心某一列时,列式存储不必翻完全部档案——只拉对应抽屉就行。
所有病人姓名集中一抽屉、所有血压集中另一抽屉;查血压平均值只需翻一个抽屉
列式vs行式数据库对比
研究视频每秒几十个特征,分析时遍历某一列——列式一定比行式快吗?
- 一行所有字段连续存于磁盘
- 单行增删改快,OLTP 首选
- 取整行只需一次 I/O
- 一列所有值连续存于磁盘
- 单行写入慢,OLAP 批量导入快
- 只读所需列,省去无关字段 I/O
列式数据库查询流程
从一条 SQL 出发,看谓词下推与向量化执行在哪个环节发力。
列式查询代码演示
用 pandas 体验列式存储的三大操作:投影、聚合、过滤
投影只读必要列、聚合走连续内存、过滤先在列上做谓词下推——这正是列式数据库查询计划的三个核心动作。
列式数据库自测
对于只涉及少数几列的分析型查询(如统计某一列的平均值),列式数据库为什么通常比行式数据库更快?
3D图形学导论
看懂虚拟世界从规则定义到可视化呈现的构建全过程
3D坐标与几何变换
上一页我们认识了3D场景的基本元素。这一页要把里面的物体「挪一挪、转一转、变大小」——这正是平移、旋转、缩放三种基本几何变换。
移动=平移、转身=旋转、远近=缩放,三步连续执行构成完整动作
投影变换流程
从左到右看:3D 点如何一步步变成屏幕像素。每个方块是一个坐标系,箭头是把它送过去的变换。
光照与着色模型
投影只决定了「点该出现在屏幕哪里」,但每个点该是什么颜色、亮不亮、要不要反光——这是光照模型的工作。没有光,3D场景就是一张灰色线稿。
油画靠画师经验调配明暗高光,照片记录真实光线的物理作用
渲染管线全流程
本页用流程图展示渲染管线三大阶段——顶点处理→光栅化→片元处理,讲解 GPU 如何把 3D 模型变成屏幕像素。
GPU渲染加速
上一页的渲染管线每帧要处理几百万三角形和上亿像素,CPU 串行执行扛不住 60fps。GPU 用并行架构和可编程着色器,把繁重工作拆给数千小核心同时干。
上千工位同时做同一步操作,工位数决定并行产能
光栅化vs光线追踪
实时与真实感的权衡
知识点总结
- ✓算力延伸认知边界,替代昂贵实验
- ✓数据规模倒逼算法与存储升级
- ✓随机性可解确定性问题
- ✓硬件特性决定软件最优架构
- ✓分层抽象让复杂系统可控
深入思考
三个问题,先自己想再翻答案。有些问题没有标准答案。
参考答案不止连续读取。同类数据相似度高带来更好的压缩,向量化批处理对CPU SIMD指令更友好,还有预计算的聚合与索引。连续读取只是必要条件,不是全部原因。
参考答案即便样本完美随机,精度仍受采样数N的平方根限制(标准差∝1/√N)。这是统计学的基本极限,与算法或随机数质量无关。想提高精度,只能增加采样量。
参考答案医学影像可视化交互少、对真实感要求高,更适合光线追踪;机器人路径仿真需要毫秒级实时反馈,光栅化更合适。核心看「实时」与「真实」哪个优先级更高。