题主问的是,“如果用电脑进行模拟,思路又是什么呢?”,所以我从更computational的角度试着回答一下。我觉得要回答这个问题首先要弄清楚的是,人识别物体运动为什么会遭遇困难?因为视觉系统的temporal resolution是存在上限的,那么当面对一个具有运动物体的视觉场景时,简单化来想,就好像一个camera以固定频率对这个场景进行拍摄。那么这时候,就会遇到一个corresponding的问题(图1):图1t时刻index两个目标物体1和2,所有物体开始运动,t+1时刻获得了个所有物体的坐标值,这时候要解决的问题判断哪个是1,哪个是2?Srivastava & Vul (2015)提出了一个计算模型去预测观测者如何完成我在上图中描述的这个追踪任务:多个视觉特征完全相同的物体同时运动,当其中的某一些被指定为target时,我们如何通过实时地监控target的运动。这个模型分为两个层级(图2),来模型视觉系统的bottom-up和top-down:图21.low-level: 模型的第一个层次是多个low-level controllers来最优估计某个时刻每一个target的位置,并且假设每个controller都是一个ideal Bayesian observer.2.high-level:模型的第二层次是一个分配注意资源的controller,这个controller根
...
继续阅读
(93)