Linux tcp_congestion_ops 拥塞控制算法结构体注册机制
Linux tcp_congestion_ops 拥塞控制算法结构体注册机制tcp_congestion_ops 是 TCP 拥塞控制算法的接口抽象定义在 include/net/tcp.h 中。所有拥塞控制算法Cubic、BBR、Reno、Westwood、DCTCP 等通过该结构体向内核注册。结构体包含拥塞控制状态的初始化、cwnd 在每个 ACK 到达时的更新、丢包事件响应、cwnd_undo撤销错误减窗以及 pkts_acked 速率采样等回调函数指针。cstruct tcp_congestion_ops {struct list_head list;unsigned long flags;__u32 key;char name[TCP_CA_NAME_MAX];struct module *owner;int (*init)(struct sock *sk);void (*release)(struct sock *sk);void (*ssthresh)(struct sock *sk);u32 (*cwnd)(const struct sock *sk);void (*cong_control)(struct sock *sk, const struct rate_sample *rs);void (*cong_avoid)(struct sock *sk, u32 ack, u32 acked);u32 (*undo_cwnd)(struct sock *sk);void (*pkts_acked)(struct sock *sk, const struct ack_sample *sample);void (*set_state)(struct sock *sk, u8 new_state);...};算法注册通过 tcp_register_congestion_control 完成函数将 ops 插入全局链表 tcp_cong_list由读写锁 tcp_cong_list_lock 保护。模块初始化时调用 tcp_register_congestion_control(tcp_cubic_ops)清理时调用 tcp_unregister_congestion_control 从链表中移除。注册过程对 ops-key 做了唯一性检查防止同一算法重复注册。cint tcp_register_congestion_control(struct tcp_congestion_ops *ca){int ret 0;if (!ca-cong_control (!ca-cong_avoid || !ca-ssthresh))return -EINVAL;write_lock(tcp_cong_list_lock);if (tcp_ca_find_key(ca-key)) {ret -EEXIST;} else if (!tcp_ca_find(ca-name)) {list_add_tail_rcu(ca-list, tcp_cong_list);pr_debug(%s registered\n, ca-name);} else {ret -EEXIST;}write_unlock(tcp_cong_list_lock);return ret;}关键验证若未实现 cong_controlBBR 风格则必须同时实现 cong_avoid 和 ssthreshclassic AIMD 风格否则返回 -EINVAL。注册时检查 name 的唯一性但 key 冲突则返回 -EEXIST。list_add_tail_rcu 将新算法追加到链表尾部使旧算法如 CUBIC 作为默认优先级更高——tcp_ca_find 首次匹配就返回链表头部是内置算法。运行时每个 TCP socket 的 icsk_ca_ops 指针通过 tcp_assign_congestion_control 赋值。该函数在 tcp_init_transfer 中调用决定算法选择优先级控制面通过 sysctl_tcp_congestion_control 设定随后检查 TCP_CONGESTION sockoptsetsockopt IPPROTO_TCP TCP_CONGESTION最后 fallback 到系统默认值。cvoid tcp_assign_congestion_control(struct sock *sk){struct net *net sock_net(sk);struct tcp_congestion_ops *ca;const char *name net-ipv4.tcp_congestion_control;if (sk-sk_txhash)name tcp_ca_get_name_by_key(sk-sk_txhash TCP_CA_KEY_MASK);if (!name)name tcp_ca_get_default(sk);rcu_read_lock();ca tcp_ca_find(name);if (unlikely(!ca)) {ca tcp_ca_find(cubic);}if (ca ! rcu_dereference(icsk-icsk_ca_ops)) {rcu_assign_pointer(icsk-icsk_ca_ops, ca);if (ca-init)ca-init(sk);}rcu_read_unlock();}这里存在动态切换路径当 __tcp_transmit_skb 处于 BH 上下文中时icsk_ca_ops 被 rcu_assign_pointer 切换读者须使用 rcu_dereference 读取。若在 tcp_ack 中不加 RCU 保护直接读取 icsk_ca_ops-cong_control在并发 tcp_set_congestion_control 被 setsockopt 调用时会出现读取到空指针或中间状态。内核通过 rcu_read_lock/rcu_dereference 包裹 tcp_cong_control 中所有对 icsk_ca_ops 的访问。拥塞控制算法切换的竞争条件tcp_set_congestion_control 被用户态线程调用时持有 lock_sock而 tcp_ack 运行在 BH 上下文中仅持有 bh_lock_sock。若 tcp_set_congestion_control 调用 ca-release旧算法析构且 ca-init新算法构造在 release 后 init 前的窗口内如果有 BH 到达并调用 ca-pkts_acked会读取到已释放的 ca 指针。解决方法是调用 synchronize_net() 等待正在执行的 BH 完成但 synchronize_net 可能睡眠因此 tcp_set_congestion_control 必须在进程上下文中调用且不能持有 spinlock。cint tcp_set_congestion_control(struct sock *sk, const char *name, bool load, bool rcu_locked){struct tcp_congestion_ops *ca;int err;ca tcp_ca_find(name);if (!ca) {if (!load)return -ENOENT;err request_module(tcp_%s, name);if (err 0)return -ENOENT;ca tcp_ca_find(name);if (!ca)return -ENOENT;}if (!try_module_get(ca-owner))return -EAGAIN;tcp_ca_switch(sk, ca);module_put(ca-owner);return 0;}icsk_ca_priv 是拥塞控制算法私有状态的存储区尺寸固定为 96 字节。CUBIC 使用的结构体 struct bictcp44 字节、BBR 使用的 struct bbr64 字节均在此区域内使用前通过 inet_csk_ca(sk) 强制类型转换。当私有状态超出 96 字节时内核在 tcp_register_congestion_control 中检查 BUILD_BUG_ON 并拒绝注册。私有数据的初始化在 ca-init(sk) 回调中完成释放时 ca-release(sk) 清理 DCTCP 的 dctcp_shadow 等额外分配内存。pacing rate 与 cwnd 的协调tcp_cong_control 调用 ca-cong_control 时传递 struct rate_sample其中包含 delivered当前 RTT 内确认的数据量和 interval_us确认间隔。BBR 依赖该数据进行带宽估计而 CUBIC 则主要使用 ca-cong_avoid 更新 snd_cwnd。两套接口的切换在 tcp_ca_dst 选择的 tcp_cong_control 内部完成如果 ops-cong_control 不为 NULL则不调用传统的 cong_avoid/ssthresh 路径。

相关新闻

AI多模态无限画布平台——完整技术设计与实现方案

AI多模态无限画布平台——完整技术设计与实现方案

AI多模态无限画布平台——完整技术设计与实现方案 一、项目概述与技术架构 1.1 项目背景 随着AIGC技术的快速发展,传统的单模态创作工具已经难以满足创作者日益复杂的需求。当前的AI创作工具多聚焦单一模态(如文生图或文生视频),创作者需要在多个工具之间反复切换,导致…

2026/7/22 6:52:17 阅读更多 →
四大AI大模型免费资源获取与优化使用指南

四大AI大模型免费资源获取与优化使用指南

1. 大模型免费资源现状解析最近各大AI厂商纷纷推出免费额度政策,DeepSeek、GLM、MiniMax、Kimi等主流大模型每天提供上亿token的免费调用额度。这波福利来得突然,但背后逻辑很清晰——厂商们正在通过免费策略培养用户习惯,为后续商业化铺路。…

2026/7/21 3:22:50 阅读更多 →
5分钟快速掌握m4s-converter:一键将B站缓存视频转换为永久MP4格式

5分钟快速掌握m4s-converter:一键将B站缓存视频转换为永久MP4格式

5分钟快速掌握m4s-converter:一键将B站缓存视频转换为永久MP4格式 【免费下载链接】m4s-converter 一个跨平台小工具,将bilibili缓存的m4s格式音视频文件合并成mp4 项目地址: https://gitcode.com/gh_mirrors/m4/m4s-converter 你是否曾经遇到过这…

2026/7/21 3:22:50 阅读更多 →

最新新闻

C++与SFML实战:从零构建经典消除游戏核心逻辑与渲染

C++与SFML实战:从零构建经典消除游戏核心逻辑与渲染

1. 项目概述:从零到一,用C和SFML复刻经典消除乐趣最近在整理自己的代码仓库,翻到了一个几年前用C和SFML写的开心消消乐小游戏。这个项目虽然体量不大,但麻雀虽小五脏俱全,从游戏循环、资源管理到核心的匹配消除算法&am…

2026/7/22 6:52:22 阅读更多 →
网文创作生态变迁:从养虾策略到人类创作价值

网文创作生态变迁:从养虾策略到人类创作价值

1. 养虾热潮背后的网文创作生态变迁去年夏天,我在一个网文作者群里第一次看到"养虾"这个词。当时有位资深编辑发了条消息:"现在平台都在养虾,你们手头有存稿的赶紧投。"起初我以为是水产养殖行业跨界到了内容领域&#x…

2026/7/22 6:52:22 阅读更多 →
DirectX修复工具核心功能与实战应用指南

DirectX修复工具核心功能与实战应用指南

1. DirectX修复工具核心功能解析DirectX Repair作为一款专注解决Windows系统图形组件问题的工具,其核心价值在于自动化处理DirectX组件异常。我在实际技术支持工作中发现,90%的游戏运行报错(特别是0xc000007b错误)都与DirectX组件…

2026/7/22 6:52:22 阅读更多 →
Java图像处理利器Thumbnailator使用指南

Java图像处理利器Thumbnailator使用指南

1. Thumbnailator简介与核心优势Thumbnailator是一个专为Java设计的轻量级缩略图生成库,它通过简洁的流式API(Fluent Interface)封装了复杂的图像处理逻辑。相比直接操作Java原生Image I/O API,Thumbnailator让开发者能够用几行代…

2026/7/22 6:52:22 阅读更多 →
如何高效实现多视频同步播放?GridPlayer专业解决方案深度解析

如何高效实现多视频同步播放?GridPlayer专业解决方案深度解析

如何高效实现多视频同步播放?GridPlayer专业解决方案深度解析 【免费下载链接】gridplayer Play videos side-by-side 项目地址: https://gitcode.com/gh_mirrors/gr/gridplayer 在多媒体处理、视频剪辑、在线教学和直播监控等场景中,同时管理和播…

2026/7/22 6:52:22 阅读更多 →
德州GEO哪家服务商好

德州GEO哪家服务商好

德州老板必看:2025年工厂被AI“抛弃”的真相,从百度第一到无人问津,只差一个GEO!德州老板的“流量焦虑”“王总,咱们厂在百度搜索结果页排第一已经三年了,但上个月大客户说,他用豆包搜‘德州汽配…

2026/7/22 6:51:22 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻