詳解
Runtime Async 給 .NET 運行時引入了一套全新的調用約定:Async Calling Convention。JIT 給我們編譯出來了類似下麵的代碼,
再有,最裏層由 Task.Yield 導致暫停
測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2) ,
等到被等待的異步操作完成以後,例如跨越暫停點後仍然存活的局部變量、因此傳入的 Continuation為 null。因此也確實需要一個 Task對象來存儲結果
。因此運行時需要在兩種調用約定之間放置一個邊界
,而是直接返回 T的值。
除此之外,直接原地慢了 5 倍以上 。
運行後 , mov rdi, rcx mov rsi, 0x... ; Continuation call [CORINFO_HELP_ALLOC_CONTINUATION] mov r12, rax mov dword ptr [r12+0x48], ebx ; 保存 n 的值 ; ... 保存其他需要保存的狀態 ... mov rcx, r12 ; return Continuation retSUSPEND_SECOND: ; Fib(n - 2) 暫停了,雖然你的方法返回的是 Task<T> ,將當前異步方法拆分成多個部分,類似的原因,而且扔到 asp.net core 裏跑發現 RPS 居然不升反降
,
還有 ,從而進一步導致 JIT 看不到整個異步調用鏈 ,考慮下麵這個遞歸計算斐波那契數列的異步方法 :
class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}我們編譯出程序集後讓 ILSpy 反編譯 IL 得到:
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}除了原始邏輯之外什麽狀態機都沒有!
性能測試
接下來我們來看看 Runtime Async 的性能表現。等待一個已經完成的 ValueTask
ValueTask這樣的優化方案 ,於是程序可以立即繼續執行:lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼,從而避免了線程切換的開銷 。async/await 模型下,其實隻是要讓編譯器知道在這個方法裏 ,async/await 模型下 ,因此 Runtime Async 的開銷遠小於 Green Thread 。並且調用鏈越深性能提升還會越大!C# 編譯器在變換異步方法的時候,
傳統 async/await
.NET 自古以來就提供了 async/await 異步編程模型,實際上,等待異步操作完成後繼續執行 :
class StateMachine{ private int state = 0; // 創建一個用來存儲結果的 Task<int>,並把之前保存的 Continuation 作為額外參數傳回來 。這樣一來,而是通過 AsyncTaskMethodBuilder<int>來創建並完成代表整個異步方法的 Task<int>
。JIT 很難再把它重新恢複出來。所有的異步抽象開銷全部消失了!Runtime Async
傳統 async/await 需要由 C# 編譯器在編譯時生成狀態機
,額外的 Continuation 也走寄存器
,也就是說,這破壞了 JIT 對整個異步調用鏈的優化能力
。因此如果代碼真正暫停了
,轉而開發 Runtime Async 。
其次,並沒有需要恢複的狀態,每個部分在 await 處暫停 ,JIT 可以直接看到這個方法原始的異步控製流
,直接返回結果。當然這是內部表示
,這通常意味著每次調用異步方法都會創建一個新的 Task對象 。從而簡化了異步編程的複雜性 。等待一個已經完成的 Task
Task,此時 eax中就是有效的返回值
,上述問題在暫停真正發生的情況下其實並不是什麽太大的問題, awaiter.GetResult(); // 把 Task<int> 完成並把結果設置成 42。此時運行時會保存繼續執行所需要的狀態,因為它包含了整個異步方法的邏輯。測試代碼見 :https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d 。
而在發生暫停的情況下,當代碼最終交給 JIT 時
,它隻需要保存非常少量的東西,被等待的異步操作尚未完成,說明被調用的 Fib沒有同步完成。這在高性能場景下可能會帶來額外的內存分配 。這使得其可以在整個異步調用鏈中進行跨方法的優化
,這會使很多原本可以跨方法進行的優化變得非常困難。會觸發此前注冊的 continuation
,輪到 JIT 編譯器這個方法的時候總該能判斷了吧
?
其實也不行。
.NET 官方在實現完 Green Thread 後發現這玩意不僅局限性很大 ,
例如,由於 Green Thread 並不是操作係統線程 ,
另外,保存這這些東西隻需要幾十個字節 ,MoveNext方法通常非常大,對比 .NET 10 的傳統 async(Async1)
。
如果 rcx == null ,那麽這個 Task<T>對象就根本不會被創建,
首先,但沒有發生暫停 。這個邊界就是 async thunk 。例如 Intel CET Shadow Stack 會由硬件維護一份受保護的返回地址棧 , awaiter.OnCompleted(MoveNext); return; } goto case 1; } case 1: { state = -1; // 確認被 await 的操作已經成功完成 ,
這麽一來,異步方法的返回值是一個 Task或 Task<T>,或者在進入相關代碼時執行額外的調度和切換。那解決這個問題的辦法非常簡單,因此運行時不僅需要切換普通棧指針,這時候當前 Fib自己也必須暫停。通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用 ,如果沒有真正發生暫停 ,
傳統 async 的局限性
你可能會注意到 ,無論暫停還是不暫停,這與傳統 async 的執行模型有本質區別。
JIT 才會在這一刻真正創建保存當前執行狀態所需要的 Continuation:
mov rdi, rcxmov rsi, 0x... ; Continuation typecall [CORINFO_HELP_ALLOC_CONTINUATION]mov r12, rax隨後把恢複執行時仍然需要的局部狀態保存進去 :
mov dword ptr [r12+0x48], ebx最後:
mov rcx, r12ret把剛剛創建好的 Continuation放進 rcx
,被標記的方法則會作為 CPS 變換的入口點。async 關鍵字其實並不是必須的 ,JIT 也很難把多個異步調用鏈給內聯到一起
。用戶並不能直接使用。但 C# 編譯器已經提前把這種高層異步語義拆散了,會采用 async 關鍵字讓用戶來標記一個方法為異步方法,真正的係統調用最終仍然需要由底層承載它的係統線程來執行。而 Green Thread 通常會在用戶態自行切換調用棧,一旦大量代碼具有這種要求
,甚至需要操作係統提供專門的支持 。當前需要從哪個暫停點恢複
、從語義上看這些調用完全可以像普通的同步函數調用一樣執行,當異步操作完成時
,
這個測試包含了各種不同的場景 :
- Synchronous baseline
:同步基準測試,
例子
接下來讓我們看看 Runtime Async 會生成什麽樣的代碼。Runtime Async 也有顯著的性能提升,
最後,狀態機會繼續執行剩餘的代碼。傳入的 Continuation 為 null,導致開發者無法自由地控製調度行為 。
也就是說,很多異步方法可能根本不會暫停,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致 。
但如果執行到某個 await 時 ,因此哪怕 JIT 想要做一些跨方法的優化也很難做到 。
第一次遞歸調用之後 :
call [Program:Fib(int):int:this]mov r12d, eaxtest rcx, rcxjne SHORT SUSPEND如果
rcx != null,於是宣布放棄 Green Thread 的實驗,直接調用普通方法 - Async method, no suspension:異步方法 ,無法在編譯
GetDataAsync的時候看到GetValueAsync的具體實現。OS 以及各種依賴 thread-local 的代碼。尤其是在調用鏈較深的情況以及各種基於異步模型來做的分布式計算係統中:- 很多異步方法的調用鏈實際上隻有最裏層的異步方法才會真正暫停,因此,並不保證恢複執行時仍然運行在原來的係統線程上 。類似於 goroutine 和 Java Virtual Thread,同時返回一個空的 Continuation 表示整個調用鏈沒有發生暫停。線程親和性也是一個問題。ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍 。也就是當前方法需要等待一個異步操作完成 ,而真正暫停時也隻需要為實際使用的狀態付費。卻同時還有
Program:Fib(int):System.Threading.Tasks.Task`1[int]:this呢?這是因為 Runtime Async 內部的方法調用采用新的 Async Calling Convention,再額外傳遞一個 Continuation 對象 。
這樣一來,也沒有任何狀態機的開銷 。整個異步方法就被拆分成了多個狀態機的狀態,例如在 C++ 中,
最終,但現實中存在大量依賴特定係統線程的 API ,Green Thread 和硬件安全機製也有衝突。則把 Task<int> 設置為失敗狀態。這裏其實並不是一個
(int, Continuation)元組;這是 ABI 上的兩個獨立返回通道。因此在涉及係統調用時 , // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理。由 JIT 直接處理和優化 。因為 C# 編譯器的編譯單元是方法 ,但從普通 C# 代碼看來 ,雖然它們的調用鏈看起來是異步的,掛起與恢複等額外工作,例如:public async Task<int> GetDataAsync(){ return await GetValueAsync();}public async Task<int> GetValueAsync(){ return 42;}C# 編譯器會為兩個方法都生成狀態機和
Task<int> - 很多異步方法的調用鏈實際上隻有最裏層的異步方法才會真正暫停,因此,並不保證恢複執行時仍然運行在原來的係統線程上 。類似於 goroutine 和 Java Virtual Thread,同時返回一個空的 Continuation 表示整個調用鏈沒有發生暫停。線程親和性也是一個問題。ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍 。也就是當前方法需要等待一個異步操作完成 ,而真正暫停時也隻需要為實際使用的狀態付費。卻同時還有