Linux CFS调度器

一直没有写过关于Linux内核调度器的内容,这几天被问起,简单的讲了讲,收到一堆challenge,这次决定做一个通篇总结方便自己整理思路。
要说Linux2.4和2.6最大的差异就在于CFS调度器的引入。CFS是 Completely Fair Scheduler 的缩写。不过讲真话,个人并不完全认同“完全公平”调度是这个算法的本意,如何裁决资源抢占(preempt,字面上是优先权)才是这个调度器的本意。

对于时分多任务操作系统来说,可以理解为调度器维护着一个任务池,确定某一时刻CPU到底应该执行哪个任务。简单粗暴一点的调度器往往就是一个round robin,也就是分配相同的时间间隔,大家简单轮流使用CPU。很显然,这种调度是最公平的,但无法满足复杂场景下的调度,于是就有了CFS模型。

至于调度,本质上是时间片管理,CFS的模型主要的改进是在round robin采用的真实运行时间片的基础上实现了一个虚拟运行时间的概念vruntime。每个线程(这里理解为系统调度的最小单位,下同)都有一个vruntime值,具体算法为:

vruntime= 权重占比 * 运行完成的时间片 * 每时间片时常

这里的权重比是nice 0 的权重和线程权重的比值,nice 0权重默认为1024。cgroup/cpu的键值cpu.shares包含的就是这个值,调整这个值可以改变vruntime的计算方式。

[root@localhost proc]# cat /sys/fs/cgroup/cpu/cpu.shares
1024

得到了这个vruntime之后,系统将会根据每个线程的vruntime排序,vruntime最小的线程则会最早获得调度。而一旦vruntime的次序发生变化,系统将尝试触发下一次调度。也就是说调度器尽可能的保证所有线程的vruntime都一致,而权重高的县城vruntime提升的慢,容易被优先调度;权重低,同样的时间上vruntime上升的快,容易被轮空。一个进程的vruntime可以通过/proc/<PID>/sched中的se.vruntime选项查看

[root@localhost 1352]# grep vruntime /proc/1352/sched
se.vruntime : 1258213807.999425

这个时候,有个比较典型的例子就是当系统中存在大量vruntime相似的线程之后,类似多米诺效应,线程调度将会被过于频繁的触发,这明显不合理!于是就如何定义“vruntime触发调度”时,CFS引入了一个阈值,即如果前后两个线程vruntime保持在一个阈值之内,系统不会触发调度。而这个阈值大小就是最小的调度时间片。

此外,CFS本质上是CPU运行时间导向的调度,这就有了另一个规则:对于sleep/IO这类的操作,由于相对来说并不占用过多资源,vruntime并不会被马上结算,仍会保持最初的vruntime。 跟到这里,你可能马上出现了一个头脑实验:一个线程A,初始值小但一直sleep,所以vruntime始终不增长;线程B,vruntime初始较大重始终排队等待,这种策略就变得不可理喻了。 所以系统在该线程被重新唤醒之后会重新计算vruntime,vruntime将取当期线程的vruntime和当前系统内最小vruntime-阈值这两个值中的最大值。也就是说如果当前系统中有两个及以上线程,当sleep/IO线程被唤醒之后,无论如何该线程将无法获得第一优先调度,最好的情况也要等当前最小vruntime接受调度之后再次触发调度。

另外,在cgroup的目录下还有两个跟CFS调度有关的设定:cpu.cfs_quota_us,cpu.cfs_period_us。 这两个值确定的是CPU时间的占空比。cpu.cfs_period_us是调度的周期,而cpu.cfs_quota_us是在这个调度周期内绝对CPU时常,单位都是微秒(us)。

cpu.cfs_quota_us / (cpu.cfs_period_us*CPU个数) = 线程CPU utilization

总结一下,如果用上下文切换的方式评价调度器的差异性:

  • 更多的线程分配到更少数量的CPU core上(不区分物理core和逻辑core),上下文切换的次数会增多。如果各个线程的优先级一致,足够多的线程分配最终的结果就是线程的切换频率等于vruntime阈值。
  • 不同的优先级调度只在需要多线程切换时才有效,即便系统中只有一个优先级很低的线程,系统仍有可能达到full utilization(满负载)。
  • CPU share的方式采用了占空比来控制cpu的utilization,跟上下文切换次数无关。
推荐阅读:
前一段时间基于PID(等比例微
事出同事对于某个设备的压力测试
首先是庆祝我们开源小站再次搬家
首先列出本站之前相关的几篇帖子

发表评论

电子邮件地址不会被公开。 必填项已用*标注

请补全下列算式: *

此站点使用Akismet来减少垃圾评论。了解我们如何处理您的评论数据