百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

记一次 .NET 某SaaS版CRM系统 崩溃分析

haoteby 2025-06-23 19:09 7 浏览

一:背景

1. 讲故事

调试训练营里的一位学员前些天找到我,说他们跑在k8s中的程序崩掉了不知道怎么回事?日志也没有记录到,让我帮他看看,dump也抓到了,既然抓到了那就看看吧。

二:程序为什么会崩溃

1. 崩溃原因

linux 上的崩溃分析没有windows上那么方便,但还是可以分析的,先通过 !t 看下是不是托管层崩溃导致的,输出如下:


0:005> !t
ThreadCount: 132
UnstartedThread: 0
BackgroundThread: 129
PendingThread: 0
DeadThread: 2
Hosted Runtime: no
Lock
DBG ID OSID ThreadOBJ State GC Mode GC Alloc Context Domain Count Apt Exception
0 1 10000557F7C7518B0 2020020 Preemptive 0000000000000000:00000000000000000000557f7c71d0c0 -00001 Ukn
5 2 b 0000557F7C6A5020 21222 Cooperative 00007FBB74F57F90:00007FBB74F59DF0 0000557f7c71d0c0 -00001 Ukn (Finalizer) System.ReferenceException 00007fbb74f05230
6 4 d 0000557F7CB53D40 21220 Preemptive 0000000000000000:00000000000000000000557f7c71d0c0 -00001 Ukn
7 6 f 0000557F7CB5C070 3021220 Preemptive 0000000000000000:00000000000000000000557f7c71d0c0 -00001 Ukn (Threadpool Worker)
...

从卦中数据来看,原来是终结器线程 抛了 空引用异常,这个还是挺有意思的。。。可遇不可求,赶紧切过去用 !pe 命令观察。


0:005> ~5s
libc_so!wait4+0x57:
00007fca`99249c17 483d00f0ffff cmp rax,0FFFFFFFFFFFFF000h
0:005> !pe
Exception object: 00007fbb74f05230
Exception type: System.ReferenceException
Message: Object reference not set to an instance of an object.
InnerException: <none>
StackTrace (generated):
SP IP Function
00007FCA968E3690 00007FCA6D8DF4A4 System_Runtime_Caching!System.Runtime.Caching.MemoryCache.OnUnhandledException(System.Object, System.UnhandledExceptionEventArgs)+0x24

StackTraceString: <none>
HResult: 80004003

0:005> k
# Child-SP RetAddr Call Site
0000007fca`968e3cb0 00007fca`98ff5635 libc_so!wait4+0x57
0100007fca`968e3ce0 00007fca`98ff6580 libcoreclr!PROCCreateCrashDump+0x275 [/__w/1/s/src/coreclr/pal/src/thread/process.cpp @ 2307]
0200007fca`968e3d40 00007fca`98ff422f libcoreclr!PROCCreateCrashDumpIfEnabled+0x770 [/__w/1/s/src/coreclr/pal/src/thread/process.cpp @ 2524]
0300007fca`968e3dd0 00007fca`98ff4159 (T) libcoreclr!PROCAbort+0x2f [/__w/1/s/src/coreclr/pal/src/thread/process.cpp @ 2555]
04 (Inline Function) --------`-------- libcoreclr!PROCEndProcess+0x7c [/__w/1/s/src/coreclr/pal/src/thread/process.cpp @ 1352]
0500007fca`968e3df0 00007fca`98cf7121 libcoreclr!TerminateProcess+0x89
0600007fca`968e3e10 00007fca`98ff81ae libcoreclr!FinalizerThread::FinalizerThreadStart+0xf1
0700007fca`968e3e30 00007fca`991ff1f5 libcoreclr!CorUnix::CPalThread::ThreadEntry+0x1fe [/__w/1/s/src/coreclr/pal/inc/pal.h @ 1763]
0800007fca`968e3ee0 00007fca`9927eb00 libc_so!pthread_condattr_setpshared+0x515
0900007fca`968e3f80 ffffffff`ffffffff libc_so!_clone+0x40
0a 00007fca`968e3f88 00000000`00000000 0xffffffff`ffffffff

从卦象看,应该是微软的 MemoryCache 导致的空引用异常,然后终结器线程进入自爆状态,这个就更有意思了。。。 接下来观察 OnUnhandledException 方法到底发生了什么。

2. OnUnhandledException 怎么啦

要想看到 OnUnhandledException 中的源代码,可以将dll给dump出来,C# 代码如下:


// System.Runtime.Caching, Version=4.0.0.0, Culture=neutral, PublicKeyToken=b03f5f7f11d50a3a
// System.Runtime.Caching.MemoryCache
private void OnUnhandledException(object sender, UnhandledExceptionEventArgs eventArgs)
{
if (eventArgs.IsTerminating)
{
Dispose();
}
}

我去,就一个if也能抛异常,这也太狗血了。。。既然抛了空引用异常,从伦理上讲应该就是 eventArgs= 导致的,那是不是的呢?这个就需要观察崩溃处的汇编代码了,即 !U 00007FCA6D8DF4A4,输出如下:


0:005> !U 00007FCA6D8DF4A4
Normal JIT generated code
System.Runtime.Caching.MemoryCache.OnUnhandledException(System.Object, System.UnhandledExceptionEventArgs)
ilAddr is00007FBAD90D54D8 pImport is000001BA2E289160
Begin 00007FCA6D8DF480, size 43

/_/src/libraries/System.Runtime.Caching/src/System/Runtime/Caching/MemoryCache.cs @ 247:
00007fca`6d8df480 55 push rbp
00007fca`6d8df481 4883ec20 sub rsp,20h
00007fca`6d8df485 488d6c2420 lea rbp,[rsp+20h]
00007fca`6d8df48a 48897df8 mov qword ptr [rbp-8],rdi
00007fca`6d8df48e 488975f0 mov qword ptr [rbp-10h],rsi
00007fca`6d8df492 488955e8 mov qword ptr [rbp-18h],rdx
00007fca`6d8df496 488b7de8 mov rdi,qword ptr [rbp-18h]
00007fca`6d8df49a 48b888451023ca7f0000 mov rax,7FCA23104588h
>>> 00007fca`6d8df4a4 393f cmp dword ptr [rdi],edi
00007fca`6d8df4a6 ff10 call qword ptr [rax]
00007fca`6d8df4a8 85c0 test eax,eax
00007fca`6d8df4aa 7410 je 00007fca`6d8df4bc

/_/src/libraries/System.Runtime.Caching/src/System/Runtime/Caching/MemoryCache.cs @ 249:
00007fca`6d8df4ac 488b7df8 mov rdi,qword ptr [rbp-8]
00007fca`6d8df4b0 48b810890d23ca7f0000 mov rax,7FCA230D8910h
00007fca`6d8df4ba ff10 call qword ptr [rax]

/_/src/libraries/System.Runtime.Caching/src/System/Runtime/Caching/MemoryCache.cs @ 251:
00007fca`6d8df4bc 90 nop
00007fca`6d8df4bd 4883c420 add rsp,20h
00007fca`6d8df4c1 5d pop rbp
00007fca`6d8df4c2 c3 ret

从卦中的 >>> 可以看出,此处即为崩溃的汇编代码 cmp dword ptr [rdi],edi,经常看 C# 汇编的朋友应该非常熟悉,这是 JIT 生成的一段 可空判断的保护代码,如果你还想更进一步确认的话,刚好上周在训练营里讲到了 linux 的 x64 调用协定,即 linux 会用 6个寄存器 rdi, rsi, rdx, rcx, r8, r9 来传送方法的前六个参数,根据刚才汇编可以看到,rdi 来源于 rdx,这个参数就是 this 指针,也就完美的佐证了。

接下来我们观察下 OnUnhandledException 方法来自于何处,分析代码之后,发现是 MemoryCache 类下的初始化方法 InitDisposableMembers 中处理的,将其注册到 AppDomain 全局异常兜底中,截图如下:

问题到此就真相大白了,如何处理呢?

3. 我该如何解决

很难想到 MemoryCache 还会存在这种新级bug,既然是第三方的,我们也不好直接修改源代码,能做的就是升级升级再升级,我们将 Version=4.0.0.0 直接干到最新的 Version=9.0.6,再次观察,结果发现已经 物是人非 了,OnUnhandledException 也没有了,InitDisposableMembers 也重构了,截图如下:

这个问题虽然解决了,但可能有些朋友会有一个疑问,为什么是终结器线程走这段逻辑,这块其实就是考验你的C# 知识,哈哈,我当年是从 CLR Via C# 中学到的。

大概是这样的,如果一个 Task 中包含了一个隐含的未处理异常,最后当终结器被析构时会抛出未处理异常,这个异常就会被全局的 AppDomain.UnhandledException 拦截,在 UnhandledException 处理的过程中又不幸再次抛出异常,最终导致程序的崩溃。

三:总结

这次生产事故是由于微软的 MemoryCache 类下的一个新手级bug导致,确实有点让人震惊,所以这个世界或许还真是一个巨大的草台班子。。。

相关推荐

谷歌开源大模型评测框架正式发布,AI模型评测难题迎刃而解

近日科技巨头谷歌正式推出其开源大模型评测框架LMEval,这一创新工具为全球AI开发者和企业提供了标准化的模型评估解决方案。LMEval的发布不仅标志着AI模型评测迈入透明化时代,更通过多项核心技术...

Android 开发中文引导-动画和图形概述

安卓系统提供了各种强大的API,用来将动画应用于界面元素和自定义2D和3D图形的绘制当中。下面的小节大概的描述了可用的API和系统功能并帮助你决定那个方案最适合你的需要。动画安卓框架提供了两种动画系统...

Qt5 C++入门教程-第12章 绘图(QPainter)

QPainter类在Qt5中进行绘图时起着重要作用。绘图操作是通过QPainter类在响应paintEvent方法时完成的。线条在第一个示例中,我们在窗口的客户区绘制了一些线条。line...

文创测评︱《如意琳琅图籍》:本土原创解谜书的胜利?

设想这样一个场景,你打开一本书,就化身为乾隆三十六年紫禁城中的画画人周本,有一天你在故纸堆中找到一本神秘的《如意琳琅图籍》,踏上寻宝旅程,历经各种离奇复杂的故事……这是故宫与奥秘之家联手打造的创意解谜...

gif动图制作攻略!快快收藏(求gif制作的动图)

有事没事斗图玩是当下人们乐此不疲的事情,手里的gif动图也渐渐成为了人们抬杠互怼的一大资本。好有趣,好炫酷,gif是怎么做出来的?我也想做。什么?你不会?没关系,我来教你!首先介绍一下制作gif动图需...

eduis未能初始化界面 无法启动 问题解决办法

1.如果edius安装后启动后出现failedtoinitializeskin中文提示无法初始化界面的错误。这说明你的电脑安装了双显卡,而edius所使用的是图形显卡。可以选择edius图标右键...

写真一周:水岛美结水着解禁、长滨祢瑠婚纱写真等

...

Flash Player模拟器更新:Rufffle(flash模拟器安卓下载高版本)

Ruffle是一个适用于WindowsPC的FlashPlayer模拟器,用Rust编写。Ruffle作为一个独立的应用程序在所有现代操作系统上原生运行,并通过使用WebAssembly在所有现代...

支持终身免费4G流量,星星充电7kW星际智能交流充电桩拆解

前言近期星星充电推出了一款星际智能交流充电桩,在正面设有灯条,可根据灯条颜色和显示直观了解充电状态,并设有屏幕显示充电状态和ui表情。充电桩支持220V/7kW充电功率,适配主流新能源车型。并支持终身...

乐动随心之fancy pop(乐动随心壶多少钱一个)

跳动飞扬的音符像是连通人与人之间心电感应的通关密码,融化陌生,拉近彼此。此次我们邀请到宅男女神江语晨,化身音乐精灵。在歌手、演员身份间游刃自如的她,为我们生动诠释了三种不同的音乐时尚风格,娴静可爱,灵...

Asus Zenflash 手机也能玩引闪,从此相机是路人

在讲解Zenflash之前,不得不提索爱的K750c,这个机器采用了氙气闪光灯,让手机的拍摄上了档次,可玩性更高,不过,说实话,当时手机的摄像头像素低,成像一般,没有掀起太大的波澜,可现在,手机的Cm...

Axure有哪些鲜为人知的使用技巧?(axure的使用教程)

阿拓带你飞:不管是想入门产品经理还是已经是PM的人对AXURE都很关注,它是制作产品原型的重要工具,但是有多少人了解AXURE的使用技巧?本文是来自“知乎问答”整理的回答,一起来看看那些不常用的使用技...

挑战黑夜 华硕ZenFlash氙气闪光灯评测

【机锋配件】说到摄影,相信许多朋友都非常喜欢,不管是外出游玩拍拍风景,还是和朋友之间聚会,都会掏出手机拍两张,在餐前拍照晒朋友圈更是成为了许多用户的日常爱好,就算不是专业的摄影爱好者,大家也都有一颗热...

WPS 演示倒计时 3 步设置!从数字动画到进度条全场景教程

做PPT时想添加倒计时却找不到入口?WPS演示自带的"动画+计时"功能就能轻松实现——无论是课堂互动的30秒答题倒计时、商务汇报的5分钟限时讲解,还是活动暖场的动...

flash动画an制作MG动画元素如何调节透明度,小白...

如何在flash动画软件里面调节mg动画元素的透明?因为flash动画软件现在已经升级为flash动画软件,所以直接用新版flash动画软件开工,基本功能都差不多,只是flash增加很多智能化、人性...