北京大学学报(自然科学版) 第62卷 第3期 2026年5月
Acta Scientiarum Naturalium Universitatis Pekinensis, Vol. 62, No. 3 (May 2026)
doi: 10.13209/j.0479-8023.2025.033
国家重点研发计划(2024YFF0506703)和国家自然科学基金(42176073, T2122012)资助
收稿日期:2025–03–27;
修回日期:2025–05–12
摘要 以美国西海岸附近的浅水台站为例, 以人工分频段识别结果为基准, 对比长短窗法(STA/LTA)及适用于 OBS 数据的机器学习方法(Blue-PhaseNet 和 Blue-EQTransformer)对 OBS 数据的地震到时识别效果, 得到如下结果。1)Blue-PhaseNet 和 Blue-EQTransformer 两种机器学习模型识别能力较弱, 正确率分别为 33.33%和14.81%, 比传统 STA/LTA 方法低 51.85%。原因可能是模型未经过本地数据集优化, 泛化能力不足; 本研究采用大震级、浅水区高噪声地震数据, 而模型训练集以微震为主, 且多为深水区数据, 二者数据特征存在明显差异。2)经海底压强记录降噪处理后, STA/LTA 方法的到时识别正确率显著提升至 96.30%, 且能识别出更多的地震事件(29 个, 高于原始数据的 27 个)。因此, 针对 OBS 数据开发的 Blue-PhaseNet 和 Blue-EQTransformer机器学习模型难以直接应用于浅水区观测数据。通过降噪提高数据信噪比后, 再利用长短窗法进行处理, 可作为 OBS 地震到时识别自动化的一种可行途径。
关键词 海底地震仪; 机器学习; 背景噪声; 到时识别
海底地震仪(Ocean-Bottom Seismometers, OBS)在海底地震观测中发挥着重要作用。但是, 受洋流、表面水波和生物活动等复杂海洋环境因素影响, OBS 数据的噪声水平高于陆地地震仪[1]。尤其在浅水区域(<300m), 能量集中在 14s 左右的海洋波浪可以穿透海水, 直接作用在仪器上, 产生很高的噪声[2]。研究浅水区域 OBS 噪声的形成机理, 降低 OBS 噪声水平, 对地震学及海洋地球物理学的发展具有重要意义。
目前针对 OBS 噪声的研究多集中于垂直分量, 并取得较成熟的被广泛认可的成果。在垂直方向, OBS 噪声主要包括倾斜噪声和屈服噪声两类。倾斜噪声主要源于海底洋流, 洋流作用会导致 OBS 发生倾斜, 并在水平通道中产生噪声[3–6], 即水平倾斜噪声。受仪器不完全水平放置的影响, 该类噪声会从水平分量泄漏至垂直分量, 进而形成垂直倾斜噪声。垂直方向的屈服噪声主要由次重力波引起, 长周期水波会导致海底压力发生变化, 引发海底形变, 使 OBS 产生微小的位移, 从而形成屈服噪声。根据半无限空间弹性模型理论解, 海底垂直形变量通常显著大于水平方向形变量, 二者的比值与纵波速度和横波速度的平方比大致相当[7]。因此, “屈服噪声”通常指垂直屈服噪声[4,8–9]。
与垂直噪声相比, 对 OBS 水平噪声的研究较少。在深海环境中, 低频水平噪声的主要来源为倾斜噪声。对倾斜噪声的产生机理以定性认识为主, 普遍认为倾斜噪声与海底洋流有关[10–15]。An 等[16]发现, 水平倾斜噪声的主要入射方向具有高度稳定性, 可能与海底水流方向有关。虽然从理论上讲可以使用垂直倾斜噪声去除水平倾斜噪声, 但由于水平倾斜噪声通常远大于垂直倾斜噪声, 该方法易造成严重的信号畸变[16]。Zhang 等[2]对比深水台站与浅水台站的功率谱密度, 发现浅水环境中水波会引起水平方向的屈服噪声和倾斜噪声, 并且水波引起的 OBS 水平噪声与海底压强的时间导数(dp/dt)成正比, 因此可以通过计算频率区间内的水平加速度与dp/dt 的比值(即水平压力传递函数), 用压强记录乘以该函数来去除对应的水平噪声。
面对浅水 OBS 数据中普遍存在的噪声问题, 亟需有效的地震信号检测方法。长短窗法(STA/LTA)是地震震相识别的经典算法, 广泛应用于陆地地震的监测[17–18], 其核心原理是通过比较信号短时窗(STA)与长时窗(LTA)内的平均能量, 捕捉地震事件的能量突变特征。当 STA/LTA 比值超过设定阈值时, 可以判断信号中存在地震事件。长短窗法的精度以及有效性取决于时窗和特征函数的选取。Rod-riguez[19]将平稳离散小波变换(SDWT)与传统长短窗法相结合, 提升了识别地震信号的性能。Wong等[20]提出修正能量比法(MER), 在无噪信号中的检测效果与传统长短窗法相当, 在含噪信号中则表现出更强的抗干扰能力。然而, 浅水 OBS 台站受强噪声干扰严重, 波形信噪比低, 长短窗方法易出现误检和漏检, 难以满足实际应用的需求。
近年来, 机器学习在地震信号处理领域展现出强巨大的潜力, 利用机器学习探究 OBS 噪声成因并实现 OBS 噪声压制, 成为重要的发展方向。机器学习在地震数据领域的模型训练主要依赖带人工标注到时的数据集。陆地地震仪数量充足, 采集便捷, 信号噪声较低, 因此地震领域常用的机器学习模型(如 PhaseNet 和 EQTransformer 等)均以带标注的陆地地震仪数据为训练样本[21–22]。相比之下, 海底地震仪数据噪声复杂, 噪声水平较高, 导致地震波到时识别难度较大, 因此相关机器学习研究起步相对较晚。Ruppert 等[23]在 AACSE 实验的 OBS 数据中直接应用 EQTransformer 模型, 结果显示, 对震中距小于 300km 的地震波形, 该模型仅能识别出 59%的 P 波和 63%的 S 波, 且对外隆起地区的地震波形识别效果尤为不佳。Niksejel 等[24]构建一个 OBS 数据库, 采用 EQTransformer, PhaseNet, GPD, PickNet和 AIC 拾取器 5 种方法进行相位标注, 将至少 3 种方法一致的拾取结果作为最终标注。最终, 该数据库包含 3.6 万组带标注的地震波形。他们以 EQ-Transformer 为基准模型, 在上述数据库中进行全量微调的迁移学习, 结果表明, 在震中距大于 200km的范围内, 优化后的模型相较于原始的 EQTrans-former 模型, P 波和 S 波识别的召回率得到显著的提升。Bornstein 等[25]整合 15 个不同地震实验的数据, 组建一个 OBS 数据库, 基于该数据库, 研究人员通过迁移训练, 得到机器学习模型 Blue-PhaseNet 和Blue-EQTransformer。这两个模型分别以传统模型PhaseNet 和 EQTransformer 为基础, 具备更精准的到时识别能力。但是, Blue-PhaseNet 和 Blue-EQ-Transformer 的训练和测试均基于该 OBS 数据库, 对其他地区(尤其是浅水区域)实际采集数据的识别效果有待验证。
基于上述研究现状, 本文以人工分频段滤波结果作为分析基准, 对比机器学习方法(Blue-Phase-Net 和 Blue-EQTransformer)与传统长短窗方法的到时识别效果, 探讨上述两种机器学习方法在浅水OBS 数据中的适用性, 为浅水 OBS 数据到时识别提供可行的优化路径。
为比较机器学习方法(Blue-PhaseNet 和 Blue-EQTransformer)与传统长短窗方法对浅水 OBS 台站数据的到时识别效果, 本研究选择用 IRIS 机构的7D 台网上的 3 个浅水台站(水深小于 100m) FN02C, FN03C 以及 FN04C 进行分析。台站位于美国西海岸 Cascadia 地区(图 1), 仪器的观测时段为 2013—2014 年。本文依据地震目录, 筛选出观测时段内地震震级为 Mw 5.0 及以上的地震事件共 47 个, 3 个台站合计得到 141 组对应的地震波形记录。以地震目录的理论到时为基准, 截取到时前 1000s 和到时后3000s 的波形, 获得 141 组时长为 4000s 的数据片段, 每组数据包括 HH1, HH2, HHZ 和 HDH 四个通道波形, 采样率为 125Hz。FN02C~FN04C 台站均配备 Nanometrics Trillium Compact 宽频带速度型地震计。本研究利用 SAC 软件的 transfer 命令, 对HH1, HH2 和 HHZ 通道原始数据去除仪器响应, 并将波形从速度转换为加速度。采用 Paroscitific绝对压力计, 测量绝对压强的变化。
为对比机器学习方法和传统方法到时识别能力的差异, 需采用带有精准震相到时标注的数据库作为评价基准, 人工分频段方法可以用来标注实际采集的 OBS 数据的地震到时。人工分频段滤波方法主要依赖人眼观测地震波形, 通过对极低频到中频的详细拆分滤波来识别震相。本文将地震波形数据分为 0.01~0.02, 0.02~0.05, 0.05~0.08, 0.08~0.1, 0.1~ 0.2, 0.2~0.5, 0.5~1, 1~2 和 2~5Hz 多个频段, 通过观察各频段滤波后的地震波形图像, 实现对 P 波到时的判读与确定, 结果如图 2 所示。
在使用长短窗法前, 需要对原始数据进行滤波处理, 滤波频段与人工目视识别波形采用的频段一致。以 FN02C-5 事件为例, 原始数据滤波至 0.1~0.2Hz时可以识别地震信号, 因此长短窗法输入采用该频段的滤波数据。从图 2 可见, 在 FN02C-5 波形组中, 长短窗法的到时标注结果比机器学习方法的标注结果更靠近人工标注。
本文采用的机器学习方法为 PickBlue 模型, 是Blue-PhaseNet 和 Blue-EQTransformer 的统称, 二者分别由基础模型 PhaseNet 和 EQTransformer 迁移改进而来。PhaseNet 是 Zhu 等[22]基于医学图像分割领域的 U-Net 模型开发的震相拾取模型, EQTransfor-mer 是 Mousavi 等[21]等基于自然语言处理领域的Transformer 模型开发的震相拾取模型。PhaseNet以 U-Net 为骨干网络, 包括 4 个编码层和 4 个解码层, 编码层提取特征, 解码层将特征映射为震相概率分布, 网络各层级间设置跳跃连接, 用于提升训练结果的收敛性能。跳跃连接可以缓解梯度消失和梯度爆炸问题, 因为梯度在反向传播过程中会逐渐衰减, 导致浅层网络的权重难以更新, 跳跃连接可以为梯度提供一条“更短”的路径, 使得梯度可以直接流向较浅的层。PhaseNet 网络结构如图 3 所示。
该模型训练数据来自北加利福尼亚地震数据中心(NCEDC), 共有约 78 万组地震波形样本, 每组均包含 Z, N, E 三分量波形数据及对应的 P 波和 S 波到时信息, 数据采样率为 100Hz。预处理流程包括归一化与概率掩码赋值。考虑到人工拾取时间点可能与真实 P 波和 S 波到时有一定的误差, 采用高斯分布形状掩码, 即手动拾取时间点对应最高概率, 附近数据点概率逐渐降低。模型在 NCEDC 数据集上的性能测试结果如下: P 波拾取精度和召回率分别为 93.9%和 85.7%。EQTransformer 模型基于注意力机制, 能够结合全局和局部特征, 模型包含 17 个编码层, 解码层设有 3 个分支, 每个分支为 8~10 层。3 个分支分别映射输出地震信号概率、P 波概率和 S波概率。实验中选用 STEAD 数据集作为训练集, 该数据集包含约 100 万组地震波形和 30 万组噪声波形, 每组地震波形均含 Z, N, E 三分量数据以及 P 波和 S 波到时信息。采样率设置为 100Hz, 数据处理流程包括振幅归一化以及 1~45Hz 带通滤波处理等步骤。模型在 STEAD 数据集上的测试结果表明, P波拾取的精度与召回率均达到 99%。
如前所述, 现有模型均采用陆地地震数据完成训练与测试, 易导致模型在处理海底地震仪数据时泛化能力受限。因此, Bornstein 等[25]以 OBS 台站数据为训练集, 构建 PickBlue 模型。该模型包括Blue-PhaseNet 和 Blue-EQTransformer 两个子模块, 分别以 PhaseNet 和 EQTransformer 为基础架构来设计。其中, Blue-PhaseNet 的网络架构和 PhaseNet 完全一致, 只在输入通道维度存在差异: PhaseNet 为 3通道, 而 Blue-PhaseNet 采用四通道输入, 额外增加了水听器分量。在 EQTransformer 的基础上, Blue-EQTransformer 不仅将输入通道调整为四通道, 还对 LSTM 层进行优化改进。LSTM 是一种特殊的循环神经网络结构, 相较于标准的循环神经网络, 通过引入三门控机制和细胞状态, 能够捕捉更长距离的时序依赖关系。Blue-EQTransformer 将原始模型EQTransformer 中自定义的 LSTM 层替换为 Py-Torch标准 LSTM 层, 并显示配置 LSTM 层的参数, 有效地提升模型的稳定性和可维护性。

台站位于美国西海岸附近, FN02C, FN03C 和FN04C 三个台站的水深分别为 67, 93, 104 m
图1 本文使用的台站示意图
Fig. 1 Location of the stations used in this study
上述研究所用训练集包括 15 项不同的地震实验, 包含 335 个 OBS 台站, 共计 109210 组地震波形, 每组地震波形均包含 Z, N, E 三分量以及水听器分量共四通道信息, 采样率为 100Hz。数据预处理流程包括缺失分量零值填充、统一重采样至 100Hz以及数据归一化等操作。模型测试结果表明, Blue-PhaseNet 的 P 波拾取平均绝对误差(MAE)为 0.32s, 均方根误差(RMSE)为 0.37s; 在相同测试集下, 原始 PhaseNet 的 MAE 和 RMSE 分别为 0.33 和 0.36s, 整体来看 Blue-PhaseNet 性能略优。Blue-EQTrans-former 经预训练后, P 波拾取的 MAE 和 RMSE 分别为 0.32 和 0.33s, 而原始 EQTransformer 的 MAE 和RMSE 分别为 0.34 和 0.35s。通过对比可知, Blue-EQTransformer 不仅拾取精度略为优于 EQTransfor-mer, 异常值占比也更低。
为评估 PickBlue 模型在浅水 OBS 数据上的应用性能, 并优选模型最佳参数配置, 本文采用 Blue-PhaseNet 和 Blue-EQTransformer 两种机器学习模型开展试验。两类模型完成地震波形预测后均可输出 P 波概率, 机器学习自动识别 P 波到时的典型实例如图 4 所示。人工识别的到时在第 1000s, 两种机器学习模型在第 1000s 附近均有超出阈值的 P 波概率输出。本文以 Blue-PhaseNet 为研究对象, 依次对输入数据时长、采样率和滤波频段进行敏感性测试, 以便确定最优参数组合。本文定义 Pmax 为 P 波到时前后 20s 内模型输出的最大 P 波概率。在此基础上, 将识别正确率定义为 Pmax 超过预设阈值的地震事件在 27 个人工标注 P 波到时地震事件中的占比。参照文献[26]的阈值选取思路, 本文将 Blue-PhaseNet 模型的阈值设为 0.3, Blue-EQTransformer模型的阈值设为 0.2。

(a)~(d)分别为原始地震事件FN02C_5的HH1, HH2, HHZ和HDH四个分量; (e)~(h)为不同分量滤波后的波形及识别结果
图2 不同方法对地震波形的识别结果
Fig. 2 Results of seismic waveform identification using different methods

图3 PhaseNet 的网络架构[22]
Fig. 3 PhaseNet network diagram[22]
首先保持原始采样率 125Hz, 且不做滤波处理, 仅改变输入数据时长(依次设置为 60, 120, 180, 240, 300, 400, 600, 1000, 1400 和 2000s)。实验结果表明, Pmax均值在 0.20~0.23 之间, 识别正确率为 22.2%~ 33.3%, 可见数据时长变化对模型 P 波概率输出的影响较小。固定数据时长为 2000s, 不进行滤波, 分别设置采样率为 125, 25 和 5Hz 开展测试。结果显示, Pmax均值区间为 0.15~0.23, 识别正确率为11.1%~33.3%。125Hz 采样率下识别正确率最高,因此确定最优采样率为 125Hz, 后续试验中均采用该采样率。

图4 机器学习方法的识别结果
Fig. 4 Results from machine learning methods

(a)~(d)分别为FN02C_5滤波后的四分量波形, 分别为HH1, HH2, HHZ和HDH。虚线代表此处长短窗的比值大于阈值
图5 长短窗方法识别地震信号
Fig. 5 Phase identification using the STA/LTA method
进一步固定数据时长为 2000s、采样率为 125Hz, 将滤波频段设置为 0.01~0.02, 0.02~0.05, 0.05~ 0.08, 0.08~0.1, 0.1~0.2, 0.2~0.5, 0.5~1, 1~2, 2~5 和 5~ 10Hz 进行对比测试。结果表明, Pmax均值为 0.03~ 0.21, 识别正确区间为 0~33.3%, 各滤波频段下的Pmax均值与识别正确率峰值均未优于无滤波工况。因此, 后续试验中统一采用最优参数组合: 数据时长为 2000s, 采样率为 125Hz, 不进行滤波处理。
长短窗方法又称 STA/LTA[17–18], 其基本原理是, 通过不同时长的时间窗口来分析信号。其中, STA 和 LTA 分别代表地震波形在固定时长的短时窗和长时窗内的平均值, 当波形发生突变时, STA的变化速率远大于 LTA。设定固定阈值后, 波形突变会使 STA/LTA 比值超过阈值, 据此可识别出地震信号。长短时窗及其比值的计算公式为
, (1)
, (2)
, (3)
式中, N和 M分别为短时窗和长时窗内的采样点数, Y(n)为地震信号, R为长短时窗比值。本文采用的长短窗法, 输入数据经过滤波预处理, 滤波频段根据人工分频段滤波方法选取。以 FN02C_5 台站数据为例, 在 0.1~0.2Hz 滤波频段内, 可清晰地观测到地震波形, 因此将该组数据的长短窗滤波频段选为0.1~0.2Hz, 结果如图 5 所示。本文针对单个地震事件对应的 4 个通道数据分别开展长短时窗分析, 选取识别效果最好的通道结果(任一通道出现有效标注即可)作为最终识别结果。

图6 长短窗法使用不同阈值时的准确率
Fig. 6 Results of the STA/LTA method with different STA/LTA threshold
我们将长短窗法的阈值选定为 3。阈值选取过程如下: 针对 141 个事件波形, 将 STA/LTA 比值在1~6 范围内逐一调整, 观察不同阈值下长短窗法的输出结果。其中, 27 条波形含人工标注到时, 判定规则如下: 如果在到时前后 20s 内输出地震波到时, 且对应概率大于设定阈值, 则判定为识别正确, 正确识别样本数记为 TP。剩余 114 条无人工标注的波形, 判定规则如下: 如果整条波形的时序内均未出现概率超过阈值的地震波输出结果, 则判定为识别正确, 正确识别样本数量记为 TN。总体准确率计算率公式为
, (4)式中, a为无地震波形样本的加权系数。
准确率综合考虑了地震和非地震的正确识别能力, 结果如图 6 所示。当 a=0 时, C=TP/27, 对应图6 中黑色曲线, 在阈值较低(STA/LTA<2.5)区间, 准确率呈下降趋势, 原因是随着阈值增大, 长短窗超出阈值的结果减少, 导致 C数值降低。当a趋于无穷大时, C≈TN/114, 对应图 6 中灰色曲线。可以看到阈值较低时, 准确率趋近 0, 说明低阈值下长短窗对非地震信号的甄别效果较差, 因此阈值应选取大于 2.5 的数值。同时, 需兼顾地震事件的有效拾取能力。当阈值大于 4 时, 可正确识别的地震波形数量快速下降。综合考虑地震事件与非地震事件干扰信号的检测效果, 我们选取 3 作为后续长短窗法的阈值。
表1 到时识别结果
Table 1 Arrival time detection results

序号波形名称滤波频段/Hz人工识别P波到时/s长短窗降噪后长短窗Blue-PhaseNetBlue-EQTransformer 1FN02C_10.02~0.051740是是否否 2FN02C_20.1~0.21740是是否否 3FN02C_50.1~0.21760是是否否 4FN02C_60.02~0.051760是是否否 5FN02C_70.05~0.081760是是否否 6FN02C_140.05~0.081080否是是否 7FN02C_150.08~0.11310否是否否 8FN02C_160.02~0.051060是是是否 9FN02C_250.05~0.081080否是否否 10FN02C_330.1~0.21060否是是否 11FN03C_100.2~0.51630是是否否 12FN03C_140.02~0.051080否是是否 13FN03C_150.1~0.21310否是否否 14FN03C_160.02~0.051050是是是是 15FN03C_250.1~0.21080否否否否 16FN03C_330.1~0.21060否是否是 17FN03C_360.1~0.21060否是否否 18FN03C_390.1~0.21080否是否否 19FN04C_10.02~0.051740是是否否 20FN04C_70.02~0.051760是是否否 21FN04C_100.1~0.21630是是否否 22FN04C_140.1~0.21100是是是否 23FN04C_160.1~0.21060是是是是 24FN04C_240.1~0.21100否是否否 25FN04C_250.1~0.21100否是否否 26FN04C_330.08~0.11060否是是是 27FN04C_360.1~0.21060是是是否 数量142694 正确率/%51.8596.3033.3314.81
采用人工方法对 141 个数据片段开展分析, 对各数据片段进行分频段滤波后, 判断其中是否存在清晰的 P 波到时。结果表明, 共有 27 个数据片段可实现 P 波到时的清晰识别。表 1 给出各数据片段对应的 P 波到时、所属频段及各类方法的检测结果, 其中人工识别法和长短窗法做了滤波处理, 机器学习方法未进行滤波处理。
以人工分频段滤波识别得到的 27 个含 P 波到时波形为基准, 长短窗法、Blue-PhaseNet 和 Blue-EQTransformer 三种方法的正确识别波形数量依次为 14, 9 和 4 个, 对应的识别正确率分别为 51.85%, 33.33%和 14.81%。实验结果说明, 针对高噪声浅水区 OBS 数据, 长短窗法和两种机器学习方法对地震信号的识别效果均不理想, 且机器学习方法的识别性能劣于长短窗法。Blue-PhaseNet 和 Blue-EQ-Transformer 的训练集数据来自全球 15 个不同地区的观测实验, 但不包括 Cascadia 地区, 因此对该区域 OBS 数据的泛化能力不足, 主要原因可归纳为以下 3 个方面。
1)地震震级的差异。本研究输入的数据震级均在 Mw 5.0 以上, 而模型训练集为全球 OBS 观测数据, 以微震或小震为主, 其中 Mw 5.0 及以上震级的地震波形占比只有 0.30%。大震级的地震波形周期更长, 一个完整的地震波时长远远超过训练集统一设置的 30s 时长。模型训练集中 30s 时长对应3000 个采样点, 通常包含完整的地震波信号。但是, 对于长周期的大震级数据, 3000 个采样点难以覆盖有效信号特征, 导致输入数据与训练样本特征不匹配。
2)区域数据的缺失。模型的训练集数据不包括 Cascadia 地区, 而各区域的地质构造和海底环境差异很大, 因此模型可能无法有效地识别该区域特有的地震信号模式。
3)浅水噪声的特性。模型的训练集以深水台站数据为主, 有 83.30%的台站水深大于 200m, 而本文采用台站的水深分别为 67, 93 和 104m。浅水台站 OBS 数据噪声受表面水波影响, 深水台站受该扰动的影响则较弱。

图7 不同方法的识别结果
Fig. 7 Identification results of different methods

(a)~(d)分别为 FN02C_15 的四分量波形, 0.05~0.08 Hz 是人工能观察到最明显地震波形的频段, 其中人工标注的结果来自(e)~(h), 人工标注在第 1000 s; (e)~(h)是FN02C_15降噪后的四分量波形和长短窗法识别结果
图8 降噪后长短窗法的正确率
Fig. 8 Accuracy of the STA/LTA method

(a)~(d)为FN03C_5的四分量, 滤波频段为能观察到最明显地震波形的0.05~0.1 Hz, 其中人工标注的结果来自(e)~(h), 降噪前人工分频段滤波不能观察到P波到时; (e)~(h)是FN03C_5降噪后的四分量, HH1, HH2和HHZ方向人工都能观察到较清晰的P波到时, 人工标注在第1000 s
图9 FN03C_5 降噪前后的长短窗法识别结果
Fig. 9 Comparison of STA/LTA arrival time picks for FN03C_5 before and after denoising
为直观地对比各类方法的识别结果, 对识别结果进行可视化展示(图 7), 以人工识别得到的 27 个 P波到时的数据片段为参照进行对比分析。图 7(a)对比人工识别基准下, 普通长短窗法与降噪后长短窗法的识别结果, 二者分别正确识别 14 个和 26 个样本, 可见低震级区间内, 降噪后长短窗法的识别效果明显优于普通长短窗法。降噪后长短窗法先对垂直通道和水平通道分别进行降噪处理, 再引入长短窗法。图 7(b)为同一人工识别基准下, Blue-EQ-Transformer 和 Blue-PhaseNet 的识别结果, 分别正确识别 4 个和 9 个样本。
Zhang 等[2]提出, OBS 台站的水平噪声以水波噪声为主, 且该噪声与 dp/dt成正比; 通过计算频率区间内的水平加速度和 dp/dt的比值, 即可利用压强记录剔除相应的水平向噪声。针对人工分频段滤波、长短窗法以及机器学习方法均无法有效识别地震波形的问题, 本文引入上述降噪方法进行数据预处理, 降噪后可实现地震波形的人工有效识别。该降噪方法具体流程如下。
首先选取特定频段滤波(如 0.05~0.1Hz), 再分别对垂直通道和水平通道开展降噪处理。对于垂直通道, 通过计算各通道间互相关参数, 反演仪器倾斜角度, 利用水平观测记录去除垂直倾斜噪声。同时, 计算台站压力传递函数, 将压力记录与传递函数相乘, 得到垂直通道的屈服噪声并予以去除。对于水平通道, 计算频率区间内的水平加速度与 dp/dt的比值(即水平压力传递函数), 再将 dp/dt与该函数相乘, 估算水平噪声分量, 进而实现水平噪声剔除。
采用上述降噪方法处理数据后, 再结合长短窗法进行地震事件识别, 可以提升长短窗法的识别准确率。降噪后的长短窗法能够在人工标注的前后20s 内正确地识别地震到时。本研究针对人工分频段滤波已识别出的 27 个地震事件, 对原始观测数据先进行降噪处理, 再采用长短窗法进行识别, 正确识别事件数量由 14 个提升至 26 个, 识别正确率由51.85%提升至 96.30%, 具体情况如表 1 所示。以FN02C-15 事件为例, 原始数据直接采用长短窗法无法实现有效识别, 经本文方法降噪后, 长短窗法能准确地识别地震到时(图 8)。
降噪方法还可识别出分频段滤波方法难以捕捉的部分地震事件。如图 9 所示, 采用本文降噪方法可以得到更多地震到时。人工分频段滤波共识别出27 个地震事件, 降噪方法则识别出 29 个地震事件。两种方法重合的事件为 22 个, 即降噪方法可额外识别出 7 个分频滤波未能捕捉的地震事件。上述结果表明, 相较于常规分频段滤波, 降噪方法对微弱地震事件的识别能力更强。
本文以人工分频段滤波结果作为分析基准, 对比机器学习方法(Blue-PhaseNet 和 Blue-EQTransfor-mer)与传统长短窗方法的到时识别效果, 得到以下结论。
1)Blue-PhaseNet 和 Blue-EQTransformer 两类机器学习方法的到时识别能力偏弱, 识别正确率低于长短窗法。
2)对浅水区 OBS 数据开展降噪处理, 可有效地提升地震波形信噪比。在此基础上, 采用长短窗法进行到时识别, 能进一步提高信号识别成功率。
3)先对浅水区 OBS 数据降噪, 再采用长短窗法开展识别, 是浅水区 OBS 地震信号自动化识别的有效技术方案。
参考文献
[1] 刘亚楠, 刘保华, 刘晨光, 等. 南海东部次海盆地震背景噪声分析. 海洋地质与第四纪地质, 2021, 41 (2): 109–117
[2] Zhang Chun, An Chao. Water-wave-induced OBS noi-se: theories, observations, and potential applications. Journal of Geophysical Research: Solid Earth, 2024, 129(4): e2023JB027787
[3] Bell S W, Forsyth D W, Ruan Youyi. Removing noise from the vertical component records of ocean-bottom seismometers: results from year one of the Cascadia Initiative. Bulletin of the Seismological Society of America, 2015, 105(1): 300–313
[4] Crawford W C, Webb S C. Identifying and removing tilt noise from low-frequency (<0.1 Hz) seafloor verti-cal seismic data. Bulletin of the Seismological Society of America, 2000, 90(4): 952–963
[5] Essing D, Schlindwein V, Schmidt-Aursch M C, et al. Characteristics of current-induced harmonic tremor signals in ocean-bottom seismometer records. Seismo-logical Society of America, 2021, 92(5): 3100–3112
[6] Reddy T R, Dewangan P, Arya L, et al. Tidal triggering of the harmonic noise in ocean-bottom seismometers. Seismological Research Letters, 2020, 91(2A): 803–813
[7] Crawford W C. The sensitivity of seafloor compliance measurements to sub-basalt sediments. Geophysical Journal International, 2004, 157(3): 1130–1145
[8] Crawford W C, Webb S C, Hildebrand J A. Estima- ting shear velocities in the oceanic crust from comp-liance measurements by two-dimensional finite differen-ce modeling. Journal of Geophysical Research: Solid Earth, 1998, 103(B5): 9895–9916
[9] Wei S S, Wiens D A, Zha Y, et al. Seismic evidence of effects of water on melt transport in the Lau back-arc mantle. Nature, 2015, 518: 395–398
[10] Duennebier F K, Blackinton G, Sutton G H. Current-generated noise recorded on ocean bottom seismome-ters. Marine Geophysical Researches, 1981, 5: 109–115
[11] Duennebier F K, Sutton G H. Fidelity of ocean bottom seismic observations. Marine Geophysical Researches, 1995, 17: 535–555
[12] Sutton G H, Duennebier F K. Optimum design of ocean bottom seismometers. Marine Geophysical Researches, 1987, 9: 47–65
[13] Trehu A. A note on the effect of bottom currents on an ocean bottom seismometer. Bulletin of the Seismolo-gical Society of America, 1985, 75(4): 1195–1204
[14] Webb S C. Long-period acoustic and seismic mea-surements and ocean floor currents. IEEE Journal of Oceanic Engineering, 1988, 13(4): 263–270
[15] 马倩茹, 华清峰. OBS南海极低频噪声与地震观测数据初步分析//中国声学学会水声学分会 2021—2022年学术会议论文集. 青岛: 446–449
[16] An Chao, Cai Chen, Zhou Lei, et al. Characteristics of low-frequency horizontal noise of ocean-bottom sei-smic data. Seismological Society of America, 2022, 93(1): 257–267
[17] Allen R. Automatic phase pickers: their present use and future prospects. Bulletin of the Seismological Society of America, 1982, 72(6B): S225–S242
[18] Allen R V. Automatic earthquake recognition and ti-ming from single traces. Bulletin of the Seismological Society of America, 1978, 68(5): 1521–1532
[19] Rodriguez I V. Automatic time-picking of microseis-mic data combining STA/LTA and the stationary dis-crete wavelet transform. 2011
[20] Wong J, Han L, Bancroft J C, et al. Automatic time-picking of first arrivals on noisy microseismic data. 2009
[21] Mousavi S M, Ellsworth W L, Zhu Weiqiang, et al. Earthquake transformer — an attentive deep-learning model for simultaneous earthquake detection and phase picking. Nature Communications, 2020, 11(1): 3952
[22] Zhu Weiqiang, Beroza G C. PhaseNet: a deep-neural-network-based seismic arrival-time picking method. Geophysical Journal International, 2019, 216(1): 261–273
[23] Ruppert N A, Barcheck G, Abers G A. Enhanced regional earthquake catalog with Alaska amphibious community seismic experiment data. Seismological Society of America, 2023, 94(1): 522–530
[24] Niksejel A, Zhang Miao. OBSTransformer: a deep-learning seismic phase picker for OBS data using automated labelling and transfer learning. Geophysical Journal International, 2024, 237(1): 485–505
[25] Bornstein T, Lange D, Münchmeyer J, et al. PickBlue: seismic phase picking for ocean bottom seismometers with deep learning. Earth and Space Science, 2024, 11(1): e2023EA003332
[26] 尹欣欣, 杨晓鹏, 蔡润, 等. 基于 PhaseNet 的地震信号自动处理方法准确性分析. 大地测量与地球动力学, 2022, 42(8): 870–873
Study on Arrival Time Identification of Large Earthquakes from High-Noise OBS Data in Shallow Water Areas
Abstract Taking shallow-water ocean-bottom seismometer (OBS) stations near the US West Coast as an example, using manually identified frequency-band results as a benchmark, this study compares the earthquake arrival-time picking performance of the Short-Term Average/Long-Term Average (STA/LTA) method and two machine learning models developed for OBS data (Blue-PhaseNet and Blue-EQTransformer). The results show that 1) Both Blue-PhaseNet and Blue-EQTransformer exhibit poor detection capability, with accuracies of 33.33% and 14.81%, respectively, which are 51.85% lower in accuracy than the traditional STA/LTA method. This is likely because the models have not been optimized for local datasets, resulting in insufficient generalization. Furthermore, this study uses large-magnitude earthquake data with high noise in shallow-water environments, whereas the training datasets consist predominantly of microseismic events from deep-water areas, leading to significant differences in data characteristics. 2) After denoising using hydrophone pressure records, the arrival time picking accuracy of the STA/LTA method improves significantly to 96.30%, and more seismic events are identified (29 events, compared with 27 in the raw data). Therefore, Blue-PhaseNet and Blue-EQTransformer cannot be directly applied to shallow-water observations. Denoising to improve the signal-to-noise ratio followed by STA/LTA processing represents a feasible automated approach for OBS earthquake arrival-time identification.
Key words Ocean-Bottom Seismometer; machine learning; background noise; arrival-time identifuation