Journal of Korea Water Resources Association. 31 August 2026. 921-935
https://doi.org/10.3741/JKWRA.2026.59.8.921

ABSTRACT


MAIN

  • 1. 서 론

  • 2. 자료 수집 및 전처리

  •   2.1 연구 대상지역

  •   2.2 준실시간 위성강수자료

  •   2.3 지점 강수 관측자료

  •   2.4 기타 입력변수

  •   2.5 자료 전처리

  • 3. 방법론

  •   3.1 LightGBM

  •   3.2 모델 구조 설계

  •   3.3 하이퍼파라미터 최적화

  •   3.4 평가지표

  • 4. 연구 결과 및 논의

  •   4.1 보정 정확도 비교

  •   4.2 관측소 밀도 분석

  •   4.3 입력 변수 기여도 분석

  •   4.4 월누적 강우량 분석

  • 5. 결 론

1. 서 론

신뢰성 있는 강수 자료는 재해 대응 및 홍수 예측에 필수적인 수문 모의의 정확도 확보에 중요하다. 우량계 관측은 정밀한 지점 기반 관측값을 제공하지만, 강수의 공간적 변동성을 표현하는 데는 본질적인 한계를 지닌다(Zeng et al., 2018). 이러한 한계를 극복하기 위해 위성 및 레이더 기반 정량적 강수 추정 기법이 개발되었으며 시공간 해상도와 정확도 측면에서도 지속적인 발전이 이루어지고 있다(Tang et al., 2020; Shi et al., 2020; Zhou et al., 2022).

위성강수자료(Satellite Precipitation Products, SPPs)는 높은 시·공간 해상도의 전지구 강수 정보를 제공하여 희소하고 불균등한 지상 관측망을 효과적으로 보완할 수 있다(Gado et al., 2017; Long et al., 2016; Meng et al., 2023). 위성강수자료는 우량계 자료를 이용한 보정의 적용 여부에 따라 실시간(real-time) 산출물과 보정(gauge-calibrated) 산출물로 구분된다(Zhang et al., 2022). 이 중 공개 지연시간이 짧은 준실시간(Near-Real-Time, NRT) 위성강수자료는 전지구 수문 모니터링 및 단기 홍수 예측과 같은 수문학적 응용에서 중요한 역할을 한다(Hong et al., 2007; Zhou et al., 2014). 그러나 이러한 장점에도 불구하고 위성강수자료는 적외선 및 마이크로파 센서의 한계로 인해 강수를 과대 또는 과소 추정하는 경우가 많다. 특히 준실시간 위성강수자료는 신속한 전달을 위해 보정이 최소화되어 있어 상당한 오차를 포함하며 수문 모의 및 홍수 예측과 같은 실시간 응용에서는 추가적인 편의 보정 기법이 필수적이다(Chen et al., 2020; Liu et al., 2023).

이에 따라 관측 센서의 강수 추정 오차를 개선하려는 연구뿐만 아니라 추정된 강수값을 수문학적으로 활용하기 위해 편의를 보정하는 기법에 관한 연구도 다양하게 수행되어 왔다. 주요 통계 기법으로는 확률밀도함수(Probability Density Function) 기반 보정(Xie and Xiong, 2011; Shen et al., 2014), 지리 편차 분석(Geographical Difference Analysis)과 이를 확장한 동적 GDA (Cheema and Bastiaanssen, 2012; Duan and Bastiaanssen, 2013; Wang et al., 2021), 크리깅(Kriging) 기반 공간 보간(Manz et al., 2016), 선형 스케일링(Linear Scaling) 및 누적분포함수(Cumulative Distribution Function) 매칭(Mastrantonas et al., 2019; Wei et al., 2022) 등이 제안되어 왔다. 그러나 이러한 전통적인 통계 기반 기법은 계통 오차를 줄일 수 있지만, 극값을 모의하거나 무작위 오차를 처리하는 등 위성과 지상관측 간의 상관성을 개선하는 데는 한계가 있는 것으로 나타났다(Ma et al., 2019; Shen et al., 2021).

이러한 한계를 보완하기 위해 최근에는 기계학습과 같은 지능형 데이터 기반 기법이 위성강수자료의 병합 및 편의 보정에 점차 활발히 적용되고 있다(Zounemat-Kermani et al., 2021). 통계적 방법이 강수 자료 간의 명시적 관계를 규명하는 데 유리하지만 기계학습(Machine Learning, ML) 기법은 다양한 자료를 처리하고 비선형 관계를 포착하는 데 효과적이며 여러 산출물의 강수 자료를 동시에 보정 및 병합할 수 있다는 장점이 있다(Yin et al., 2021). 예를 들어 Baez-Villanueva et al. (2020)Nguyen et al. (2023)은 위성강수자료를 지상 관측과 병합하는 데 있어 기계학습 기법이 전통적인 통계적 방법을 능가하는 성능을 보임을 입증하였다. 또한 Zhang et al. (2021)은 랜덤 포레스트 기반 이중 병합 기법을 적용하여 강수 추정값의 정밀한 시·공간 편의 보정을 달성하였으며, Lei et al. (2022)Meng et al. (2023)은 기계학습 모델과 전통적인 통계 기법을 결합하여 준실시간 위성강수자료의 편의를 저감하였다. 이처럼 ML 기반 앙상블 기법은 통계 기반 기법에 비해 위성강수자료의 시·공간적 편의를 보정하는 데 더 효과적인 것으로 평가되고 있다.

그러나 높은 시간 해상도를 갖는 준실시간 위성강수자료의 상당한 불확실성과 변동성을 해결하기 위한 연구는 여전히 부족하다. 다수의 보정 알고리즘은 후처리를 전제로 설계되어 실시간 자료의 편의를 충분히 다루지 못하며(Mastrantonas et al., 2019), 기계학습 기반 보정은 학습을 위한 정답 자료로 지상관측을 요구하는 지도학습 방식이 주를 이루므로 관측망이 희소한 지역에서의 적용 가능성이 핵심 쟁점으로 남아 있다. 특히 입력변수별 정보가 보정 성능에 기여하는 상대적 비중이 규명되지 않아 주된 활용 대상인 저밀도 관측 유역에서 기대할 수 있는 성능 수준을 추정하기 어렵다.

따라서 본 연구는 남한을 대상으로 이중기계학습 기법을 활용하여 다중 준실시간 위성강수자료의 시·공간 편의를 보정하고 관측망 밀도에 따른 보정 성능의 변화를 정량화함으로써 저밀도 관측 지역에서의 적용 가능성을 평가하는 것을 목적으로 한다. 남한은 기상청이 운영하는 고밀도 AWS 관측망을 통해 위성 격자당 최소 1개소의 지상관측이 확보되는 지역으로, 관측망 밀도를 인위적으로 축소하며 성능 변화를 관찰하기에 적합한 테스트베드에 해당한다. 이러한 설계는 미계측 대유역에서 직접 수행하기 어려운 밀도(density)와 성능(accuracy) 관계 규명을 가능하게 한다. 보정 모형으로는 LightGBM을 채택하여 회귀 단독 구조(Single Machine Learning, SML)와 분류-회귀 결합 구조(Double Machine Learning, DML)를 구성하였다. 입력변수는 3종의 준실시간 위성강수자료(IMERG V07-Early, GSMaP Gauge-NRT V8, PERSIANN V3)에 지형변수(고도, 경사), 기상변수(기온, 습도), 공간자기상관 변수(NE, POP)를 결합하여 구성하였다. 보정 결과는 원시 위성자료 3종, 선형 결합 기법 3종, 지상관측 기반 IDW와 비교하였으며 학습 지점 밀도를 100%에서 10%까지 축소하며 성능 변화와 공간자기상관 및 기상 변수의 기여도를 분석하였다.

2. 자료 수집 및 전처리

2.1 연구 대상지역

본 연구의 대상지역은 남한 전역(33.0-39.0°N, 124.0-131.0°E)을 선정하였다. 남한은 국토면적 약 100,364 km2로 삼면이 바다에 접하고 북쪽으로 아시아 대륙과 연결되어 있으며 중위도 온대 기후대에 위치하여 뚜렷한 사계절을 나타낸다. 연강수량의 상당 부분이 여름철 장마와 태풍에 집중되는 강한 계절성을 보이며 국토의 약 70%가 산지로 구성되어 지형 기복에 따른 강수의 공간 변동성이 크게 나타난다. 이러한 기후와 지형학적 조건은 위성강수자료의 편의가 증가하기 쉬운 환경으로 보정 기법의 성능을 다양한 조건에서 평가하기에 적합하다. 또한 남한은 기상청(Korea Meteorological Administration, KMA)이 운영하는 고밀도 자동기상관측망(Automatic Weather System, AWS)을 보유하고 있어 위성 격자 규모(0.1°, 약 10 km)에서 대부분의 격자당 1개소 이상의 지상관측이 확보되므로, 관측망 밀도를 인위적으로 축소하며 보정 성능의 변화를 정량화하기에 적합한 지역이다. 대상지역의 지형과 AWS 지점 분포는 Fig. 1과 같다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F1.jpg
Fig. 1.

Study area

2.2 준실시간 위성강수자료

위성 기반 강수 추정은 수동 마이크로파(Passive Microwave, PMW) 센서를 탑재한 저궤도 위성과 적외(Infrared, IR) 센서를 주로 활용하는 정지궤도 위성의 관측을 결합하는 방식으로 이루어지며 각 위성강수자료는 하나 이상의 위성 자료를 통합하는 고유의 추정 알고리즘을 적용한다(Huffman et al., 2020). 준실시간 위성강수자료는 이러한 산출물 중 짧은 지연시간으로 제공되어 실시간 홍수감시 및 예·경보에 활용된다. 본 연구에서는 추정 알고리즘 계열이 상이한 3종의 NRT SPP로 IMERG-Early, GSMaP-Gauge-NRT, PERSIANN-V3를 선정하였다. 세 자료는 각각 PMW-IR 결합 칼만필터 방식, 우량계 보정이 적용된 PMW-IR 방식, IR 기반 딥러닝 방식으로 각 추정 원리가 서로 다르므로 이를 결합할 경우 단일 알고리즘의 계통 오차를 상호 보완할 수 있다. 각 자료의 특성은 Table 1과 같다.

Table 1.

Summary on SPPs dataset information

Products
(Provider)
Full name Coverage Spatial resolution Temporal resolution Latency Reference
IMERG-Early
(NASA)
Integrated Multi-satellite Retrievals for GPM-Early run Global 0.1°
(≈10 km)
half-hourly 4 hour Tan et al. (2019), Huffman et al. (2020)
GSMaP-Gauge-NRT
(JAXA)
Global Satellite Mapping of Precipitation - Gauge - NRT Global 0.1°
(≈10 km)
hourly 4 hour Kubota et al. (2007), Ushio et al. (2009)
PERSIANN-V3
(UCI CHRS)
Precipitation Estimation from Remotely Sensed Information using Artificial Neural Networks - U-Net Global 0.04°
(≈4 km)
hourly 1 hour Nguyen et al. (2026)

IMERG (Integrated Multi-satellitE Retrievals for GPM)는 NASA GPM (Global Precipitation Mission)의 다위성 강수 추정 알고리즘으로 다수 위성의 PMW·IR 센서 자료를 결합하여 0.1°, 30분 간격의 전지구 강수를 산출한다. 본 연구에서 사용한 Early Run은 우량계 보정과 후방향 전파를 제외하여 약 4시간의 지연시간을 갖는다. V07은 최대 강우강도 상한 제거와 SHARPEN 기법 도입 등을 통해 V06 대비 극한 강수의 표현력과 계통편의가 개선되었으며, 세부 알고리즘은 Huffman et al. (2020)에 상세히 기술되어 있다. 자료는 NASA GES DISC (https://disc.gsfc.nasa.gov/)를 통해 수집하였다.

GSMaP (Global Satellite Mapping of Precipitation)은 IMERG와 같이 GPM 프로젝트의 JAXA에서 제공하는 전지구 강수자료로 PMW 복사계로 순간 강우강도를 산출하고 IR 기반 대기운동벡터로 강수 영역을 전파하여 0.1°, 1시간 해상도의 강수를 추정한다(Kubota et al., 2007; Ushio et al., 2009). 본 연구에서 사용한 Gauge-NRT 산출물은 직전 30일의 통계 파라미터를 이용해 GSMaP-NRT를 보정한 우량계 보정 준실시간 자료이며 지연시간은 약 4시간이다. 다만 보정에 사용되는 NOAA/CPC 자료는 0.5°·일 단위 해상도로 시간 단위 국지 호우의 편의는 잔존할 수 있다. 자료는 JAXA Global Rainfall Watch (https://sharaku.eorc.jaxa.jp/GSMaP/)를 통해 수집하였다.

PERSIANN (Precipitation Estimation from Remotely Sensed Information using Artificial Neural Networks)은 UC Irvine CHRS에서 개발한 인공신경망 기반 강수 추정 자료이다. 본 연구에서 사용한 V3는 U-Net 구조의 심층 신경망이 적외 위성영상으로부터 강수를 직접 추정하는 방식으로, 구름 패치 분류에 기반한 이전 세대 PERSIANN-CCS와 알고리즘 계열이 상이하며 0.04° 해상도와 약 1시간의 지연시간으로 세 자료 중 가장 신속하게 제공된다(Nguyen et al., 2026). 자료는 CHRS Data Portal (https://chrsdata.eng.uci.edu/)을 통해 수집하였다.

세 자료의 수집기간은 2021년 1월 1일부터 2025년 12월 31일까지 총 5년이며 이 중 2021-2023년을 모형 학습, 2024년과 2025년을 각각 독립적으로 성능 검증에 활용하였다.

2.3 지점 강수 관측자료

위성강수자료 보정을 위한 종속변수 및 입력변수로 기상청 AWS 자료를 활용하였다. AWS는 남한 전역에 조밀하게 분포하며 강수량, 기온, 습도, 풍향·풍속 등을 1분 단위로 기록하여 제공하며 기상자료개방포털(https://data.kma.go.kr/)에서 수집하였다. 원자료인 1분 단위 강우량은 1시간 누적강우량으로 집계하였다. 관측자료는 한국표준시(KST), 위성자료는 협정세계시(UTC) 기준이므로 지점자료의 시각에서 9시간을 감하여 UTC로 정렬하였으며, 시간 누적은 위성자료와 동일하게 구간 종료시각(예: 01:00 = 00:00-01:00 누적)을 사용하였다.

지점 선별은 두 단계로 수행하였다. 첫째, 결측률 필터로서 전체 574개소에 대해 연도별 결측률을 산정하고, 2021-2025년 중 한 해라도 결측률이 10%를 초과하는 지점을 제외하였다. 이는 특정 연도에만 자료가 양호한 지점으로 인해 학습-검증 간 관측망 구성이 달라지는 것을 방지하기 위함이다. 이 단계에서 107개소가 제외된 467개소의 연도별 최대 결측률은 1.07% - 9.78%로 모두 임계값 이내였다. 둘째, 격자 중복 필터로서 동일한 0.1° 격자셀 내에 복수의 지점이 위치하는 경우 종속변수인 관측 강수의 자료 품질을 확보하기 위하여 가장 결측률이 낮은 지점 1개소만을 선정하였다. 한 셀 내의 복수 지점은 동일한 위성 입력값에 서로 다른 레이블이 대응되는 구조를 형성하고 특정 셀의 표본을 과다 대표하여 학습을 편향시킬 수 있기 때문이다. 두 단계를 거쳐 최종 413개소를 확정하였다.

2.4 기타 입력변수

지형변수로는 SRTM (Shuttle Radar Topography Mission) 1 arc-second (약 30 m) DEM으로부터 고도와 경사를 산출하였다. 강수의 지형성 강화와 산악지역의 국지적 강수 변동성을 모형에 반영하기 위하여 두 변수를 입력에 포함하였다. 공간자기상관 변수로는 인접 지점의 강우정보를 반영하는 NE (Neighborhood Estimate)와 POP (Probability of Precipitation)를 구성하였다. NE는 인접 관측지점의 강우량을 거리 역가중으로 결합한 값이며, POP는 인접 지점 중 강우가 발생한 지점의 가중 비율이다. 두 변수는 강수의 공간적 연속성을 모형에 제공하기 위한 것으로 Zhang et al. (2021)이 제안한 구조를 따랐으며 구체적인 산정 절차는 3.2.2절에 기술하였다.

기상변수로는 AWS 지점에서 관측된 기온과 상대습도를 사용하였다. 기온은 Clausius-Clapeyron 관계를 통해 대기의 수증기 보유능력을 결정하며 대기 중 수분량은 기온과 극한 강수 강도를 연결하는 매개 변수로 작용한다(Hardwick Jones et al., 2010; Huang et al., 2019). 다만 약 20~26°C 이상에서는 수분 가용성 저하에 따라 강수 강도가 기온에 대해 음의 스케일링을 보인다(Hardwick Jones et al., 2010; Huang et al., 2019). 특히 상대습도의 상한이 감소하기 시작하는 기온과 강수 강도 스케일링의 변곡점이 서로 일치한다는 점에서 상대습도는 대기의 수분 보유능력이 아닌 실제 수분 가용성을 지시하는 변수로서 의미를 가진다(Hardwick Jones et al., 2010).

두 변수는 지점 관측자료로서 격자 형태의 위성 입력과 공간 단위가 상이하지만 본 연구의 학습과 정량 평가가 모두 지점 단위(point-to-pixel)로 수행되므로 격자로 내삽하지 않고 해당 지점의 관측값을 그대로 사용하였다. 이는 내삽 과정에서 원 관측에 없던 오차가 입력변수에 유입되는 것을 방지하기 위함이다. 다만 격자 단위의 월 누적 강수량 산정 시(4.4절)에는 격자별 기온 및 상대습도 입력이 필요하므로 인접 5개 지점을 이용한 역거리가중법으로 내삽하여 적용하였다. 이 경우 내삽에 따른 불확실성이 입력에 포함되므로 격자 추론 결과는 지점 단위 평가 결과와 구분하여 해석하였다. 전체 입력변수의 구성은 Table 2와 같다.

Table 2.

Input variables and target for model training

Category Variable Source Raw resolution Preprocessing
Satellite precipitation IMERG-Early V07 Multi-satellite PMW·IR 0.1° / half-hourly Summed to hourly
GSMaP-Gauge-
NRT V8
Multi-satellite PMW·IR (gauge-adjusted) 0.1° / hourly None
PERSIANN V3 GEO-IR imagery (deep learning) 0.04° / hourly Nearest-grid extraction
Topography Elevation SRTM 1 arc-second DEM 30 m Averaged to 0.1° grid
Slope SRTM 1 arc-second DEM 30 m Computed at 30 m, averaged to 0.1° grid
Meteorological Temperature KMA AWS Station / 1 min Averaged to hourly
Humidity KMA AWS Station / 1 min Averaged to hourly
Spatial autocorrelation NE KMA AWS Station / 1 min Hourly sum and IDW
(k = 5, leave-one-out)
POP KMA AWS Station / 1 min Hourly sum and IDW
(k = 5, leave-one-out)
Target Precipitation KMA AWS Station / 1 min Summed to hourly

2.5 자료 전처리

세 위성자료는 원 단위와 시간구조가 상이하므로 1시간 누적강우량(mm)으로 통일하였다. IMERG는 30분 단위 강우강도(mm/hr) 2개 값에 각각 0.5시간을 곱하여 합산하였고, 1시간 단위인 GSMaP과 PERSIANN은 강우강도 값이 곧 1시간 누적량에 해당한다. 세 자료 모두 파일명이 구간 시작시각을 나타내므로 종료시각 레이블로 변환하여 지점자료와 정렬하였다.

공간해상도는 IMERG의 0.1° 격자를 기준격자로 설정하고 대상 도메인에 위도 60개, 경도 70개, 총 4,200개 셀을 구성하였다. PERSIANN V3는 0.04°의 원 해상도를 유지한 채 지점별 최근접 셀 값을 추출하였다. 지점 단위 평가에서는 공통 격자로의 업스케일이 불필요하며 업스케일은 오히려 원자료의 고해상도 공간정보를 손실시키기 때문이다. 다만 4.4절의 월 누적 강수량 산정에서는 세 위성자료의 격자 정합을 위해 PERSIANN을 기준격자(0.1°)로 최근접(Nearest) 샘플링을 수행하였다.

경사는 원 해상도(30 m)에서 계산한 후 0.1° 격자로 평균 집계하였다. 음의 고도값은 해수면 및 SRTM 오차에 해당하여 0으로 처리하였으며 지점의 지형값은 해당 지점이 속한 0.1° 셀의 대표값을 사용하여 위성 입력과 공간 스케일을 일치시켰다.

최종 413개소는 0.5° 격자 기반의 공간 분포를 고려한 무작위 방식으로 학습 296개소와 검증 117개소(약 7:3) 로 분할하였다. 이 방법은 학습 및 검증 지점의 지역적 편중을 방지하고 난수 시드를 고정하여 재현성을 확보하였다. 검증 지점은 입력 변수에서 완전히 제외하여 검증 지점의 관측정보가 어떠한 경로로도 학습에 유입되지 않도록 구성하였다.

3. 방법론

3.1 LightGBM

LightGBM (Light Gradient Boosting Machine)은 Ke et al. (2017)이 제안한 경사부스팅 결정트리(Gradient Boosting Decision Tree, GBDT) 기반의 앙상블 학습 알고리즘이다. GBDT는 다수의 결정트리를 순차적으로 학습시키되 각 트리가 이전 트리들의 잔차를 보완하도록 구성하여 최종 예측을 산출한다. 이는 개별 트리를 독립적으로 학습한 뒤 평균 또는 다수결로 결합하는 Random Forest의 배깅(bagging) 방식과 구별되며 오차를 단계적으로 축소하는 구조로 인해 일반적으로 더 높은 예측 정확도를 나타낸다. 트리 t 단계에서의 목적함수는 Eq. (1)과 같이 표현된다.

(1)
L(t)=i=1Nyi,y^i(t-1)+ftxi+Ωft

여기서 은 개별 표본의 예측 오차를 나타내는 손실함수, y^i(t-1)은 직전 단계까지의 누적 예측값, ft는 현 단계에서 추가되는 트리 함수, Ωft는 리프 수와 리프 가중치의 크기를 제어하는 정규화항이다. 트리 복잡도가 정규화항으로 목적함수에 직접 포함되므로 학습 과정에서 정규화 계수를 통해 과적합을 명시적으로 통제할 수 있으며, 이는 앙상블 평균화와 사전 설정된 구조 제약에 의존하여 과적합을 완화하는 배깅 방식과 구별되는 특징이다.

LightGBM은 기울기 기반 단방향 표본추출(Gradient-based One-Side Sampling, GOSS)과 배타적 변수 묶음(Exclusive Feature Bundling, EFB)을 도입하여 기존 GBDT의 학습 효율을 크게 개선한 알고리즘으로 트리 성장과 분할점 탐색에서 채택된 두 기법은 본 연구의 자료 구조에 부합한다. 첫째, 같은 깊이의 모든 노드를 균등하게 분할하는 level-wise 방식과 달리 손실 감소량이 가장 큰 리프를 우선 분할하는 leaf-wise 성장 방식은 동일한 트리 수에서 더 큰 손실 감소를 달성한다. 시간 단위 강수자료는 무강우 표본이 대다수를 차지하는 불균형 구조를 가지므로 이 방식은 소수의 강우 표본이 집중된 영역에 분할을 우선 배분하여 균등 분할 대비 강우 사상의 표현에 유리하다. 다만 트리가 비대칭적으로 심화되어 과적합 위험이 증가하므로 리프 수와 최소 리프 표본수에 대한 최적화가 요구된다. 둘째, 연속형 변수를 이산 구간(bin)으로 변환한 뒤 구간 경계에서만 분할점을 탐색하는 히스토그램 기반 방식은 분할점 후보 수가 구간 수로 고정되어 표본 수 증가에 따른 계산 비용의 민감도가 낮다. 따라서 모든 관측값을 후보로 평가하는 사전정렬 방식과 달리 5년간 시간 단위로 축적된 수백-수천만 행 규모의 다지점 자료에 효율적으로 대응할 수 있으며 이산화에 따른 정확도 손실은 구간 수가 충분할 경우 무시할 수 있는 수준으로 보고되었다(Ke et al., 2017).

3.2 모델 구조 설계

3.2.1 SML 및 DML

본 연구에서는 위성강수의 편의 보정을 위해 두 가지 모형 구조를 구성하였다. SML은 회귀 모형 단독으로 입력변수로부터 강우량을 직접 추정하는 구조이며, DML은 분류 모형과 회귀 모형을 결합하여 강우 발생 여부와 강우량을 각각 추정한 후 두 결과를 결합하는 구조이다. 각 구조의 추정식은 Eqs. (2) and (3)과 같다.

(2)
P^SML=freg(X)
(3)
P^DML=fcls(X)freg(X)

여기서, P^는 보정된 강우량(mm), X는 입력변수 벡터, ​freg는 회귀 모형, fcls​는 분류 모형, ⊙는 요소별 곱(Hadamard product)이다. 분류 레이블은 강우 임계값 0.1 mm를 기준으로 정의하였으며 분류 모형의 확률 출력을 0.5 기준으로 이진화하여 강우 발생 시 1, 무강우 시 0의 값을 부여하였다. Eq. (3)의 요소별 곱은 지점 단위 추정에서는 해당 지점의 분류 결과와 회귀 추정값의 곱으로, 격자 단위 추정에서는 두 출력 배열의 대응 격자 간 곱으로 적용된다. 따라서 분류 모형이 무강우로 판정한 요소는 회귀 추정값과 무관하게 0으로 처리되고, 강우로 판정한 요소만 회귀 추정값이 유지된다.

두 구조의 병행 평가는 시간 단위 강수자료의 분포 특성에 근거한다. 무강우 시각이 전체 표본의 대다수를 차지하는 조건에서 회귀 모형 단독의 SML은 무강우 구간에 미소한 양의 값을 산출하는 경향이 있으며 이는 누적 시 계통적 과대추정과 강우 탐지 정확도 저하로 이어진다. DML은 분류 단계에서 무강우를 명시적으로 0으로 처리하여 이러한 문제를 구조적으로 차단하지만, 분류 경계 부근의 오분류가 실제 강우를 소거할 위험을 내포한다. 이처럼 두 구조의 상대적 우열은 자료 특성에 의존하므로, 본 연구에서는 두 구조를 동일 조건에서 학습하고 성능을 비교하였다.

본 연구의 DML 구조는 Zhang et al. (2021)의 접근법을 따르지만 기반 알고리즘으로 LightGBM을 사용하고 입력변수에 지상관측 기상변수를 추가하였으며 관측망 밀도에 따른 적용 가능성을 평가하였다는 점에서 차별성을 가진다.

3.2.2 공간자기상관 변수 산정

강수는 공간적 연속성을 지니므로 인접 지점의 관측정보는 대상 지점의 강우 추정에 유효한 정보를 제공한다. 이를 모형 입력에 반영하기 위하여 Zhang et al. (2021)이 제안한 구조에 따라 NE (Neighborhood Estimate)와 POP (Probability of Precipitation)를 구성하였다. 대상 지점 i의 시각 t에 대한 두 변수는 Eqs. (4), (5), (6)과 같이 산정된다.

(4)
wij=1/dij2j=1k1/dij2
(5)
NEi,t=j=1kwij·Pj,t
(6)
POPi,t=j=1kwij·IPj,t0.1

여기서, wij는 대상 지점 i와 인접 지점 j간의 정규화된 거리 역가중치, dij는 두 지점 간의 거리(m), Pj,t​는 인접 지점 j의 시각 t에서의 관측 강우량(mm), I는 지시함수, k는 인접 지점 수를 나타낸다. kZhang et al. (2021)의 연구에 따라 5를 적용하였다.

NE와 POP 산정 시 대상 지점 자신의 관측값은 제외하는 leave-one-out 기법을 적용하였다. 대상 지점의 관측값이 포함되면 레이블 정보가 입력변수에 직접 유입되는 정보 누출이 발생하여, 학습 성능은 인위적으로 상승하는 반면 미계측 지점으로의 일반화 성능이 감소할 수 있다. 이에 따라 매 시각·매 지점마다 대상 지점을 제외한 최근접 5개 지점을 독립적으로 선정하였다.

3.2.3 비교 방법론

보정 성능의 상대적 평가를 위하여 세 계열의 비교군을 구성하였다. 첫째, 원시 위성자료 3종(IMERG, GSMaP, PERSIANN)은 보정 이전의 기준선에 해당한다. 둘째, 선형 결합 기법으로 IEVW (inverse error variance weighting), OWA (optimized weight average), OORA (one-outlier-removed average)를 적용하였다(Mastrantonas et al., 2019; Zhang et al., 2021). 이들 기법은 위성 간 오차 특성에 따라 가중치를 산정하여 다중 위성을 결합하는 방식으로, 지상관측을 명시적 레이블로 사용하지 않는다는 점에서 기계학습 기반 보정과 구분된다. 셋째, 지상관측 IDW는 위성자료 없이 지상관측만으로 강수장을 구성하는 방식으로, 실무에서 가장 널리 활용되는 방법이자 본 연구의 핵심 비교 대상이다. IDW 산정 시에는 해당 밀도에서 이용 가능한 학습 지점 전부를 사용하고 인접 지점 수에 제한을 두지 않았는데, 이는 실무 분석자가 가용한 모든 관측소를 활용하는 조건을 반영한 것으로 NE와 POP의 k=5 제약과 구분된다. 검증 지점은 내삽 소스에서 제외하였다.

이에 따라 원시 위성강수 3종, 선형 결합 3종, 지상관측기반 IDW, SML, DML의 총 9개 방법을 동일 조건에서 비교·분석하였다.

3.3 하이퍼파라미터 최적화

LightGBM의 분류 및 회귀 모형은 목적함수가 상이하므로 하이퍼파라미터를 각각 독립적으로 최적화하였다. 탐색은 6개 하이퍼파라미터에 대한 무작위 탐색(random search) 50회를 수행한 후, 성능 민감도가 높은 num_leaves와 learning_ rate에 대하여 국소 격자 탐색(grid search)으로 최적화하는 2단계로 구성하였다. 최적 조합의 선정 기준으로 분류 모형은 강우 임계값 0.1 mm에 대한 CSI 최대화 및 회귀 모형은 강우 발생 표본에 대한 RMSE 최소화를 적용하였다. 탐색용 검증자료는 학습 지점을 분할하여 구성하였으며, 최종 검증 지점은 탐색 전 과정에서 제외하여 정보 누출을 방지하였다. 도출된 최적 하이퍼파라미터는 Table 3과 같다.

Table 3.

Search space and optimized hyperparameters of the LightGBM classifier and regressor

Hyperparameter Description Search space Classifier Regressor
num_leaves Maximum number of leaves per tree 31-200 109 58
learning_rate Shrinkage rate of each boosting step 0.005-0.1 0.0208 0.023
n_estimators Number of boosting iterations 200-600 251 382
subsample Row sampling ratio per iteration 0.6-1.0 0.691 0.724
colsample_bytree Feature sampling ratio per tree 0.6-1.0 0.868 0.981
min_child_samples Minimum number of samples per leaf 20-200 189 20

3.4 평가지표

보정 결과는 정량적·정성적 지표로 평가하였으며 모든 평가는 학습에 사용되지 않은 검증 지점에 대하여 지점 단위(point-to-pixel)로 수행하였다.

정량 평가의 주 지표로는 수정 Kling-Gupta 효율계수(modified Kling-Gupta Efficiency, KGE')를 사용하였다. KGE'는 Nash-Sutcliffe 효율계수의 한계를 보완하기 위해 제안된 지표로 상관계수, 편의비, 변동성비의 세 성분으로 분해된다(Gupta et al., 2009; Kling et al., 2012). KGE' 와 각 성분의 산정식은 Eqs. (7), (8), (9), (10)과 같다.

(7)
KGE'=1-(r-1)2+(β-1)2+(γ-1)2
(8)
r=i=1NOi-μoSi-μsi=1NOi-μo2i=1NSi-μs2
(9)
β=μsμo
(10)
γ=σs/μsσo/μo

여기서, r은 피어슨 상관계수, 𝛽는 추정값과 관측값의 평균 비율로서 편의의 정도, 𝛾는 변동계수의 비율, 𝜇와 𝜎는 각각 평균과 표준편차이며, so는 각각 추정값과 관측값을 나타낸다. 𝛽>1은 과대추정, 𝛽<1은 과소추정을 의미하며 KGE'는 1에 가까울수록 정확도가 높다. KGE'를 주 지표로 채택한 것은 성능 차이가 상관구조, 계통적 편의, 변동성 중 어디에서 기인하는지를 성분별로 구분할 수 있어 보정 기법 간 비교에서 해석력이 높기 때문이다.

정성 평가는 강우 발생 탐지 성능을 대상으로 하며, 분할표(contingency table, Table 4)를 기반으로 산정하였다. 탐지성능 평가의 강우 임계값은 1, 5, 10, 20 mm를 적용하여 약한 강우부터 호우까지 강도 계층별 성능을 구분하였으며 이 중 1 mm를 주 평가 임계값으로 사용하였다. 각 지표의 산정식은 Eqs. (11), (12), (13)과 같다.

(11)
POD=HH+M
(12)
SR=HH+F=1-FAR
(13)
CSI=HH+F+M

여기서, H는 관측과 추정이 모두 강우인 경우, F는 추정만 강우인 경우, M은 관측만 강우인 경우의 표본 수이다. POD (Probability of Detection)는 실제 강우의 탐지율, SR (Success Ratio)은 강우 추정의 적중률, CSI (Critical Success Index)는 두 측면을 통합한 종합 탐지 정확도를 나타내며 세 지표 모두 1에 가까울수록 정확도가 높다. 본 연구에서는 오탐지와 미탐지를 동시에 반영하는 CSI를 주 정성지표로 사용하였다.

Table 4.

Contingency table for rain detection

Observed
Rain No rain
Estimated Rain H (hit) F (false alarm)
No rain M (miss) C (correct negative)

4. 연구 결과 및 논의

4.1 보정 정확도 비교

본 절에서는 원시 위성자료 3종, 선형 결합 기법 3종, 지상관측 IDW, SML, DML의 총 9개 방법에 대하여 2024년과 2025년 검증 지점의 정확도를 비교하였다. 정량 지표로는 KGE'와 각 성분을 사용하였고 정성 지표로는 강우 임계값 1 mm 기준의 CSI를 사용하였다. 각 방법별 분석 결과는 Table 5에 나타내었으며 지점별 분포는 Figs. 2 and 3, 강우강도별 탐지 성능은 Fig. 4에 제시하였다. Table 5의 값은 전체 검증 표본 및 시간을 통합하여 산정한 종합 성능이며 Fig. 2 and 3은 지점별로 산정된 동일 지표의 분포를 나타낸다. 이하 본문의 수치는 2024년 기준으로 서술하였으며 2025년 값은 필요시 괄호 또는 별도 문장으로 서술하였다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F2.jpg
Fig. 2.

Boxplots of KGE' for the nine methods at the validation stations

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F3.jpg
Fig. 3.

Boxplots of CSI at the 1 mm threshold for the nine methods at the validation stations

Table 5에 따르면, 원시 위성자료 3종은 모두 낮은 정확도를 보였다. IMERG의 KGE'는 0.393으로 세 자료 중 가장 높게 나타났다. 𝛽는 1.03으로 전체적인 편의는 크지 않았으나 r이 0.45로 낮고, 𝛾가 0.74에 머물러 강우 변동성을 과소 재현하는 것으로 나타났다. GSMaP의 KGE'는 0.388로 IMERG와 유사한 수준이었으며 𝛾는 0.87로 세 자료 중 변동성 재현이 가장 우수하였다. 이는 GSMaP Gauge-NRT에 적용된 CPC 우량계 보정의 효과로 판단된다. 다만 𝛽가 1.17로 과대추정 경향이 있으며 r은 0.43으로 IMERG보다 낮게 나타났는데 이는 0.5° 해상도 및 일 단위 규모 우량계 보정이 총량과 변동성은 일부 개선하나 시간 단위의 정확도는 개선하지 못하였음을 시사한다. 또한 PERSIANN의 KGE'는 -0.077로 유일하게 음의 값을 보였다. 𝛽가 1.81로 관측 대비 약 1.8배의 과대추정을 나타냈고 𝛾는 0.45로 변동성이 절반 수준으로 축소되었다. 또한 1 mm 임계값에서 POD는 0.918로 9개 방법 중 가장 높았으나 SR이 0.189에 불과하여 BIAS가 4.85에 달하였다. 이는 강우 영역을 과도하게 넓게 탐지하는 특성으로 적외 영상 기반 추정 또는 딥러닝 U-net 모델 추정 과정에서 발생하는 불확실성에 기인하는 것으로 판단된다. 이러한 자료별 특성은 2025년 검증에서도 동일하게 유지되었다(IMERG 0.327, GSMaP 0.343, PERSIANN –0.045).

Table 5.

Overall performance of the nine methods at the validation stations

Category Method 2024 2025
KGE' r 𝛽 𝛾 CSI KGE'r 𝛽 𝛾 CSI
Raw SPPs IMERG 0.393 0.452 1.03 0.741 0.329 0.327 0.426 1.134 0.675 0.29
GSMaP 0.388 0.427 1.173 0.87 0.321 0.343 0.372 1.138 0.866 0.287
PERSIANN -0.077 0.546 1.808 0.45 0.186 -0.045 0.492 1.729 0.45 0.183
Linear merging IEVW 0.268 0.557 1.355 0.538 0.366 0.227 0.505 1.354 0.523 0.333
OWA 0.228 0.564 1.405 0.507 0.367 0.189 0.513 1.407 0.494 0.333
OORA 0.211 0.556 1.419 0.5 0.358 0.169 0.508 1.431 0.488 0.326
Gauge-only IDW 0.578 0.777 1.017 0.642 0.552 0.566 0.766 1.025 0.635 0.561
ML-based SML 0.725 0.804 1.013 0.806 0.632 0.706 0.797 1.018 0.788 0.637
DML 0.755 0.803 0.98 0.856 0.629 0.738 0.794 0.991 0.837 0.625

선형 결합 기법 3종은 r이 개선되었음에도 KGE'는 오히려 IMERG보다 낮게 나타났다. IEVW의 경우 r이 0.557로 IMERG (0.452) 대비 향상되었으나 KGE'는 0.268에 그쳤다. 이는 KGE'의 성분 분해를 통해 설명된다. 결합 과정에서 𝛽가 1.36으로 증가하고 𝛾가 0.54로 감소하여 r의 개선효과가 편의와 변동성의 악화로 상쇄된 것으로 판단된다. 즉 오차 특성이 서로 다른 자료의 가중평균은 잡음 상쇄를 통해 상관관계를 개선하지만 PERSIANN의 강한 과대추정 편의가 총량에 유입되고 평균화 자체가 극값을 축소하여 변동성을 낮게 평가하는 것으로 판단된다. 결과적으로 세 기법 간 차이는 미미하였으며(2024년 KGE' 0.211-0.268, 2025년 0.169-0.227) 지상관측 없이 다중 위성을 선형 결합하는 것만으로는 편의 구조가 개선되지 않음을 보여준다. 이는 지상관측을 명시적 레이블로 활용하는 기계학습 기반 보정의 필요성을 뒷받침한다. 지상관측 IDW의 KGE'는 0.578(2025년 0.566)로 원시 위성자료와 선형 결합 기법에 비해 높게 나타났다. 𝛽가 1.02로 총량이 정확하고 r도 0.78로 높았으나 𝛾는 0.64로 변동성을 과소 재현하였다. 이는 내삽 방식에 내재된 평활화 효과로 지점 간 극값이 평균화되어 강우장의 변동이 완만해지는 특성에 기인한다.

반면에 SML과 DML은 9개 방법 중 가장 높은 정확도를 보였다. DML의 KGE'는 0.755로 IDW 대비 0.177, 최우수 원시 위성자료인 IMERG 대비 0.362 향상되었으며, 2025년에도 각각 0.172와 0.411의 향상폭을 유지하였다. 특히 DML은 𝛾가 0.856을 기록하여 IDW (0.642)보다 높게 나타났다. 이는 기계학습 보정이 지상관측의 총량 정확도를 유지하면서 위성자료로부터 강우 변동 정보를 추가로 획득함을 의미하며 내삽 기법이 구조적으로 갖는 평활화 한계를 완화한 결과로 판단된다. SML과 DML의 비교에서는 두 구조의 특성 차이가 관찰되는데 KGE'는 DML (0.755)이 SML (0.725)보다 높았으며 주로 𝛾의 차이(0.856 vs 0.806)로 판단된다. 반면 1 mm CSI는 SML 0.632, DML 0.629로 대등하였다. 성분별로 보면 DML의 POD (0.794)가 SML (0.743)보다 높고 SR (0.752)은 SML (0.810)보다 낮아 분류 단계가 강우 탐지를 확대하는 방향으로 작용하였으며 두 구조의 CSI가 대등한 것은 POD 증가와 SR 감소가 상쇄된 결과로 해석된다. 다만 𝛽는 DML (0.980)이 SML (1.013)보다 1에 근접하였고 KGE' 역시 두 검증연도에서 일관되게 높았으므로 본 연구에서는 DML의 보정 성능이 가장 우수한 것으로 판단하였다.

Fig. 4에 따르면 강우강도별 탐지성능에서는 방법별 정확도가 임계값에 따라 변화되었다. 1 mm에서는 DML (CSI 0.629)과 SML (0.632)이 IDW (0.552)보다 우수한 성능을 나타내었다. 반면 20 mm에서는 IDW의 SR이 0.818로 DML (0.654)보다 높았으나 POD가 0.137에 불과하여 CSI는 0.133으로 DML (0.293)의 절반 이하로 나타났다. 즉 IDW는 강우를 탐지할 경우 정확하나 대부분의 강우를 놓치는 반면에 DML은 탐지율과 적중률이 균형을 이루는 것으로 판단되며 이러한 임계값별 경향은 2025년에서도 동일하게 나타났다(Fig. 4). 한편 DML 역시 임계값이 높아질수록 CSI가 감소하는 경향을 나타내는데 이는 3.3절에서 기술한 바와 같이 회귀 모형이 강우 발생 표본 전체의 RMSE 최소화를 기준으로 선택되어 표본 수가 지배적인 약한 강우에 최적화된 결과로 해석되며 고강우 구간의 정확도 개선은 여전히 해결 과제로 남아있다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F4.jpg
Fig. 4.

Performance diagrams of the nine methods at rainfall thresholds of 1, 5, 10, and 20 mm

4.2 관측소 밀도 분석

본 절에서는 학습 지점의 밀도를 100%(296개소), 50%(148개소), 20%(59개소), 10%(30개소)로 축소하며 지상관측을 활용하는 세 방법의 정확도 변화를 분석하였다(Table 6, Fig. 5). 밀도 축소 과정은 학습 지점을 0.5°(약 50 km) 격자로 분할 후 격자 내에 속한 지점수에 비례하는 만큼을 무작위로 선택하는 공간 층화 무작위 추출로 수행하였다. 격자 층화 기법을 통해 저밀도 조건에서도 추출된 표본 지점이 특정 지역에 편중되지 않고 공간적으로 대표성을 가지도록 보장하였다. 이때 난수(seed)를 고정하여 각 밀도 구성 집합이 재현 가능하도록 하였다.

Table 6.

Performance of the gauge-dependent methods under reduced training gauge densities

Density (stations) Method 2024 2025
KGE' r 𝛽 𝛾 CSI KGE' r 𝛽 𝛾 CSI
100% (296) IDW 0.578 0.777 1.017 0.642 0.552 0.566 0.766 1.025 0.635 0.561
SML 0.725 0.804 1.013 0.806 0.632 0.706 0.797 1.018 0.788 0.637
DML 0.755 0.803 0.98 0.856 0.629 0.738 0.794 0.991 0.837 0.625
50% (148) IDW 0.574 0.746 1.01 0.658 0.529 0.564 0.737 1.02 0.653 0.54
SML 0.676 0.769 1.004 0.773 0.599 0.657 0.76 1.008 0.755 0.602
DML 0.71 0.765 0.96 0.835 0.6 0.691 0.754 0.97 0.815 0.595
20% (59) IDW 0.528 0.671 1.052 0.666 0.487 0.503 0.64 1.053 0.662 0.489
SML 0.602 0.708 1.037 0.731 0.546 0.57 0.69 1.039 0.705 0.546
DML 0.649 0.704 0.966 0.815 0.555 0.62 0.683 0.977 0.791 0.55
10% (30) IDW 0.467 0.566 1.072 0.699 0.429 0.415 0.538 1.016 0.642 0.44
SML 0.462 0.631 1.224 0.678 0.485 0.424 0.6 1.214 0.645 0.482
DML 0.559 0.62 1.11 0.806 0.51 0.51 0.591 1.125 0.762 0.509

Table 6Fig. 5를 보면 지상관측을 활용하는 세 방법(IDW, SML, DML)은 모두 밀도 감소에 따라 정확도가 저하되었다. DML의 KGE'는 100%에서 10%로 갈수록 0.755, 0.710, 0.649, 0.559로, IDW는 0.578, 0.574, 0.528, 0.467로 감소하여 두 방법의 격차는 +0.177, +0.136, +0.121, +0.092로 축소되었다. 2025년에서도 격차는 +0.172, +0.127, +0.117, +0.095로 동일한 경향을 보였다. NE와 POP는 각 지점에서 가장 가까운 5개 관측소의 값을 거리로 가중평균한 변수이며 5개 이웃까지의 평균거리는 관측망 밀도가 100%, 50%, 20%, 10%로 감소함에 따라 각각 23.5 km, 30.6 km, 48.6 km, 78.1 km로 증가하였다. 즉 밀도가 낮아질수록 내삽에 활용되는 지점의 거리가 물리적으로 멀어지게 되며 DML이 NE와 POP를 통해 지상관측 정보에 의존하는 구조이므로 관측망 밀도가 낮아질수록 입력변수의 대표성이 함께 저하되는 데 기인하는 것으로 판단된다. 반면 IDW는 100% 밀도에서도 𝛾가 0.642의 평활화된 추정으로 밀도 감소에 따른 추가 손실의 여지가 상대적으로 작은 것으로 나타났다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F5.jpg
Fig. 5.

Boxplots of performance metrics for the nine methods under training gauge densities of 100%, 50%, 20%, and 10% (averaged over the 2024-2025 validation years)

그럼에도 DML은 모든 밀도 수준에서 IDW보다 높은 정확도를 보였으며 10% 밀도에서도 +0.092의 차이를 유지하였다. 특히 학습 지점을 30개소(10%)까지 축소하여도 DML의 KGE'는 0.559로 296개소(100%)를 사용한 IDW의 0.578에 근접하는 수준으로 나타났다. 이는 관측망이 1/10로 감소하더라도 위성자료의 결합을 통해 고밀도 내삽에 준하는 정확도를 확보할 수 있음을 의미하며 저밀도 관측 지역으로의 DML의 활용 가능성을 뒷받침하는 결과로 판단된다.

Fig. 6에 따르면 SML과 DML의 비교에서는 밀도가 낮아질수록 두 구조의 성능 차이가 확대되었다. 두 구조의 KGE' 차이는 100%에서 0.030이었으나 10%에서는 0.097로 증가하였고, 2025년에서도 0.032에서 0.086으로 동일한 경향을 보였다. 특히 10% 밀도에서 SML의 KGE'는 0.462로 IDW (0.467) 수준까지 저하되어 지상관측 단독 내삽 대비 성능 개선이 나타나지 않았으나(2025년 0.424 vs 0.415), DML은 0.559로 IDW와의 차이를 유지하였다. SML의 𝛽는 1.224(2025년 1.214)로 팽창하여 무강우 구간의 미소 강우 산출이 총량 편의로 누적되는 경향이 뚜렷해진 반면에 DML은 1.110(1.125)으로 상대적으로 억제되었다. 이는 분류 단계가 학습 지점이 감소하는 조건에서 회귀 단독 구조의 과대추정 경향을 차단함을 보여주며 저밀도 관측 환경에서 DML 구조가 성능 유지에 기여함을 시사한다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F6.jpg
Fig. 6.

Changes in performance metrics with decreasing training gauge density

4.3 입력 변수 기여도 분석

본 절에서는 공간자기상관 변수(NE 및 POP)와 기상변수(기온 및 습도)의 기여도를 분리하기 위하여 세 가지 변수 조합을 구성하였다. Case 1은 전체 입력변수를 사용한 기준 조합이며, Case 2는 Case 1에서 공간자기상관 변수를, Case 3은 기상변수를 각각 제외한 조합이다. 세 조합을 동일한 DML 구조로 학습하여 밀도 수준별로 비교한 결과는 Fig. 7과 같다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F7.jpg
Fig. 7.

Performance metrics of three input variable combinations under different training gauge densities

공간자기상관 변수인 NE와 POP는 고밀도 조건에서 높은 기여도를 나타냈다. 2024년 기준 100% 밀도에서 Case 2의 KGE'는 0.524로 Case 1(0.755) 대비 0.231 낮았으며, CSI도 0.429로 0.200의 차이를 보였다. 2025년에서도 KGE' 기준 0.253의 격차가 나타나 두 변수가 고밀도 관측망의 정보를 모형에 전달하는 핵심 변수로 확인되었다. 그러나 이 기여는 밀도가 낮아질수록 축소되는 것으로 나타났다. 이는 관측소 수가 감소하면 NE와 POP 산정에 사용되는 인접 지점까지의 거리가 멀어지고, 원거리 지점의 강우는 대상 지점의 강우 상태와 차이가 커지므로 두 변수가 실제 강우를 반영하는 정도, 즉 대표성이 저하되기 때문으로 판단된다. 또한 Case 2의 KGE'는 100%에서 10%로 갈수록 0.524, 0.524, 0.526, 0.515로 밀도 전 구간에서 0.011 이내의 변동만을 보였으며 2025년에서도 동일한 양상이 나타났다(0.485, 0.482, 0.484, 0.474). 학습에 사용되는 관측소가 296개소에서 30개소로 감소함에도 Case 2의 성능이 유지된다는 것은, 학습 표본의 감소 자체는 성능 저하의 원인이 아님을 의미한다. 따라서 밀도 축소에 따른 Case 1의 저하(0.196)는 표본 감소가 아니라 NE와 POP의 대표성 저하에 기인하는 것으로 판단된다.

또한 기상변수의 기여는 상대적으로 작았으나 밀도가 낮아질수록 증가하는 경향을 보이고 있다. Case 3의 KGE'는 Case 1 대비 100% 밀도에서 0.009 낮지만 10% 밀도에서는 그 차이가 0.026으로 확대되었으며 2025년도 동일한 양상이 나타났다. 이는 고밀도 조건에서는 NE와 POP가 전달하는 인접 강우 정보에 가려 기상변수의 기여가 작은 것으로 나타나지만 저밀도 조건에서는 강수 발생의 물리적 선행조건을 나타내는 기상변수가 보완적 역할을 수행함을 시사한다. 위성강수자료, 지형 및 공간자기상관 변수만을 사용하는 것 보다 강우와 물리적 상관성이 높은 기상변수는 저밀도 관측 환경에서 유효변수에 해당하는 것으로 판단된다.

4.4 월누적 강우량 분석

본 절에서는 각 방법의 편의가 공간적으로 어떻게 분포하는지 확인하기 위하여 2024년과 2025년에 장마와 집중호우로 가장 큰 피해가 발생하였던 7월의 월 누적 강우량을 시각화하여 비교하였다. Figs. 8 and 9에 따르면 원시 위성자료의 편의는 월 누적 공간분포에서도 뚜렷하게 확인되었다. PERSIANN의 2024년 7월 육상 평균은 606 mm로 IDW (363 mm)의 약 1.7배에 달하였으며 이는 4.1절에서 확인된 과대추정 경향과 부합한다. 공간분포에서는 중부와 북부에 800 mm를 초과하는 광역 과대추정이 나타났다. IMERG와 GSMaP의 총량은 IDW에 근접하였으나 GSMaP은 남해안 일대를 200 mm 미만으로 추정하여 국지적 과소 영역이 관찰되었다.

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F8.jpg
Fig. 8.

Spatial distributions of monthly accumulated precipitation in July 2024 for the raw satellite products and the corrected results

https://cdn.apub.kr/journalsite/sites/kwra/2026-059-08/N0200590808/images/kwra_59_08_01_F8_F9.jpg
Fig. 9.

Spatial distributions of monthly accumulated precipitation in July 2025 for the raw satellite products and the corrected results

2025년 7월에서는 지상관측 기반 산정(IDW)은 남부(35.3°N 부근)에 동서 방향의 강수 집중대와 600 mm를 초과하는 강우 집중 영역이 나타났다. 그러나 IMERG는 총량이 IDW와 유사함에도 해당 집중대를 표현하지 못하고 남해안 일대를 200 mm 미만으로 추정하였으며 GSMaP과 PERSIANN은 강수 집중 영역이 중부 내륙으로 나타났다. 즉 위성자료의 편의는 총량뿐 아니라 강수 공간 분포의 오차로도 발현되며 이는 홍수기 응용에서 총량 지표만으로 자료의 신뢰성을 판단할 수 없음을 시사한다.

반면에 SML과 DML의 보정 결과는 총량과 공간패턴 모두에서 지상관측과 유사하게 나타났다. 2024년 7월 DML의 평균은 363 mm로 IDW와 일치하였고 SML도 거의 동일하게 나타났으며, 2025년 7월에도 DML 250 mm, SML 248 mm로 IDW의 263 mm에 근접하였다. 공간적으로는 2025년 7월의 남부 강수 집중대를 DML이 IDW와 동일한 위치에 재현하였으며 집중 강우 영역의 강도는 IDW보다 다소 강하게 표현되었다. 또한 2024년 7월 동해안 일대에서 DML은 IDW보다 낮은 값의 저강수 영역을 뚜렷하게 구분하였는데 이는 위성의 공간정보가 내삽으로는 포착하기 어려운 강수 경계의 표현에 기여한 결과로 판단된다.

5. 결 론

본 연구는 남한 전역을 대상으로 3종의 준실시간 위성강수자료(IMERG-Early, GSMaP-Gauge-NRT, PERSIANN-V3)에 지형, 기상 및 공간자기상관 변수를 결합한 LightGBM 기반 DML 보정 체계를 구축하고 관측망 밀도를 100%에서 10%까지 축소하며 보정 성능의 변화를 정량화하였다. 총 9개 방법을 2024년과 2025년의 독립 검증 지점에 대하여 비교한 주요 결과는 다음과 같다.

(1)전체 성능 비교에서 DML이 9개 방법 중 가장 우수한 성능을 나타냈다. DML의 KGE'는 0.755(2025년 0.738)로 지상관측 IDW 대비 0.177이 향상되었다. 특히 변동성비(𝛾)의 개선이 두드러져 기계학습 보정이 지상관측의 총량 정확도를 유지하며 위성의 공간정보를 반영하여 내삽의 평활화 한계를 완화함을 확인하였다.

(2)관측소 밀도 분석에서 DML은 모든 밀도 수준에서 IDW보다 우수한 성능을 보였으며 10% 밀도(30개소)의 DML (KGE' 0.559)은 100% 밀도(296개소)의 IDW(0.578)에 근접하는 정확도를 확보하였다. 또한 저밀도 조건에서 회귀 단독 구조(SML)는 총량 편의가 팽창하며 IDW 수준까지 저하된 반면에 DML은 분류 단계의 무강우 처리를 통해 이를 억제하여 분류-회귀 결합 구조의 유효성이 저밀도 환경에서 뚜렷하게 나타났다.

(3)입력변수 기여도 분석에서 공간자기상관 변수(NE 및 POP)는 고밀도 조건에서 지배적인 기여를 보이나 밀도가 낮아질수록 그 기여가 축소되었으며 이를 제외한 조합은 밀도 전 구간에서 0.011 이내의 성능 변동만을 보였다. 이로부터 DML의 밀도 의존성이 학습 표본의 감소가 아니라 인접 관측 정보의 대표성 저하에 기인함을 실증하였다. 기상변수(기온 및 습도)의 기여는 고밀도에서 미미하였으나 저밀도에서 확대되어 저밀도 관측 환경에서 보완적 역할을 수행함을 확인하였다.

다만 회귀 모형이 전체 강우 표본의 오차 최소화를 기준으로 최적화되어 고강우 구간의 탐지 정확도는 상대적으로 낮았으며 호우 사상에 특화된 학습과 사상 단위 검증이 수행되어야 한다. 또한 본 연구의 밀도-성능 관계는 남한의 기후 및 지형 조건에서 도출된 것이므로 지역별 기후에 따른 일반화 성능 점검에는 추가 분석이 요구된다. 그럼에도 본 연구의 DML 기반의 다중 보정 체계는 짧은 지연시간의 위성자료를 입력으로 하여 준실시간 운영이 가능하며 관측망 밀도가 낮은 대유역의 홍수 모니터링과 수문 모의를 위한 향상된 시·공간 강수자료 생산에 활용될 수 있을 것으로 기대된다.

Acknowledgements

이 논문은 2023학년도 경북대학교 국립대학육성사업 지원비에 의하여 연구되었음.

Conflicts of Interest

The authors declare no conflict of interest.

References

1

Baez-Villanueva, O.M., Zambrano-Bigiarini, M., Beck, H.E., McNamara, I., Ribbe, L., Nauditt, A., Birkel, C., Verbist, K., Giraldo-Osorio, J.D., and Thinh, N.X. (2020). “RF-MEP: A novel random forest method for merging gridded precipitation products and ground-based measurements.” Remote Sensing of Environment, Vol. 239, 111606.

10.1016/j.rse.2019.111606
2

Cheema, M.J.M., and Bastiaanssen, W.G.M. (2012). “Local calibration of remotely sensed rainfall from the TRMM satellite for different periods and spatial scales in the Indus Basin.” International Journal of Remote Sensing, Vol. 33, No. 8, pp. 2603-2627.

10.1080/01431161.2011.617397
3

Chen, H., Yong, B., Shen, Y., Liu, J., Hong, Y., and Zhang, J. (2020). “Comparison analysis of six purely satellite-derived global precipitation estimates.” Journal of Hydrology, Vol. 581, 124376.

10.1016/j.jhydrol.2019.124376
4

Duan, Z., and Bastiaanssen, W.G.M. (2013). “First results from Version 7 TRMM 3B43 precipitation product in combination with a new downscaling-calibration procedure.” Remote Sensing of Environment, Vol. 131, pp. 1-13.

10.1016/j.rse.2012.12.002
5

Gado, T.A., Hsu, K., and Sorooshian, S. (2017). “Rainfall frequency analysis for ungauged sites using satellite precipitation products.” Journal of Hydrology, Vol. 554, pp. 646-655.

10.1016/j.jhydrol.2017.09.043
6

Gupta, H.V., Kling, H., Yilmaz, K.K., and Martinez, G.F. (2009). “Decomposition of the mean squared error and NSE performance criteria: Implications for improving hydrological modelling.” Journal of Hydrology, Vol. 377, No. 1-2, pp. 80-91.

10.1016/j.jhydrol.2009.08.003
7

Hardwick Jones, R., Westra, S., and Sharma, A. (2010). “Observed relationships between extreme sub-daily precipitation, surface temperature, and relative humidity.” Geophysical Research Letters, Vol. 37, L22805.

10.1029/2010GL045081
8

Hong, Y., Gochis, D., Cheng, J.T., Hsu, K.L., and Sorooshian, S. (2007). “Evaluation of PERSIANN-CCS rainfall measurement using the NAME event rain gauge network.” Journal of Hydrometeorology, Vol. 8, No. 3, pp. 469-482.

10.1175/JHM574.1
9

Huang, D., Yan, P., Xiao, X., Zhu, J., Tang, X., Huang, A., and Cheng, J. (2019). “The tri-pole relation among daily mean temperature, atmospheric moisture and precipitation intensity over China.” Global and Planetary Change, Vol. 179, pp. 1-9.

10.1016/j.gloplacha.2019.04.016
10

Huffman, G.J., Bolvin, D.T., Braithwaite, D., Hsu, K.L., Joyce, R.J., Kidd, C., Nelkin, E.J., Sorooshian, S., Stocker, E.F., Tan, J., Wolff, D.B., and Xie, P. (2020). “Integrated multi-satellite retrievals for the Global Precipitation Measurement (GPM) mission (IMERG).” Satellite precipitation measurement, Edited by Levizzani, V., Kidd, C., Kirschbaum, D.B., Kummerow, C.D., Nakamura, K., Turk, F.J., Vol. 67, Springer, Cham, Switzerland, pp. 343-353.

10.1007/978-3-030-24568-9_19
11

Ke, G., Meng, Q., Finley, T., Wang, T., Chen, W., Ma, W., Ye, Q., and Liu, T.-Y. (2017). “LightGBM: A highly efficient gradient boosting decision tree.” Proceedings of the 31st Conference on Neural Information Processing Systems, Long Beach, CA, U.S., Vol. 30, pp. 3146-3154.

12

Kling, H., Fuchs, M., and Paulin, M. (2012). “Runoff conditions in the upper Danube basin under an ensemble of climate change scenarios.” Journal of Hydrology, Vol. 424-425, pp. 264-277.

10.1016/j.jhydrol.2012.01.011
13

Kubota, T., Shige, S., Hashizume, H., Aonashi, K., Takahashi, N., Seto, S., Hirose, M., Takayabu, Y.N., Ushio, T., Iwanami, K., Kachi, M., and Okamoto, K. (2007). “Global precipitation map using satellite-borne microwave radiometers by the GSMaP project: Production and validation.” IEEE Transactions on Geoscience and Remote Sensing, Vol. 45, No. 7, pp. 2259-2275.

10.1109/TGRS.2007.895337
14

Lei, H., Zhao, H., and Ao, T. (2022). “A two-step merging strategy for incorporating multi-source precipitation products and gauge observations using machine learning classification and regression over China.” Hydrology and Earth System Sciences, Vol. 26, No. 11, pp. 2969-2995.

10.5194/hess-26-2969-2022
15

Liu, X., Yong, Z., Liu, L., Chen, T., Zhou, L., and Li, J. (2023). “Improving hydrological simulation accuracy through a three-step bias correction method for satellite precipitation products with limited gauge data.” Water, Vol. 15, No. 20, 3615.

10.3390/w15203615
16

Long, Y., Zhang, Y., and Ma, Q. (2016). “A merging framework for rainfall estimation at high spatiotemporal resolution for distributed hydrological modeling in a data-scarce area.” Remote Sensing, Vol. 8, No. 7, 599.

10.3390/rs8070599
17

Ma, Q., Xiong, L., Xia, J., Xiong, B., Yang, H., and Xu, C.Y. (2019). “A censored shifted mixture distribution mapping method to correct the bias of daily IMERG satellite precipitation estimates.” Remote Sensing, Vol. 11, No. 11, 1345.

10.3390/rs11111345
18

Manz, B., Buytaert, W., Zulkafli, Z., Lavado, W., Willems, B., Robles, L.A., and Rodríguez-Sánchez, J.-P. (2016). “High-resolution satellite-gauge merged precipitation climatologies of the Tropical Andes.” Journal of Geophysical Research: Atmospheres, Vol. 121, No. 3, pp. 1190-1207.

10.1002/2015JD023788
19

Mastrantonas, N., Bhattacharya, B., Shibuo, Y., Rasmy, M., Espinoza-Dávalos, G., and Solomatine, D. (2019). “Evaluating the benefits of merging near-real-time satellite precipitation products: A case study in the Kinu basin region, Japan.” Journal of Hydrometeorology, Vol. 20, No. 6, pp. 1213-1233.

10.1175/JHM-D-18-0190.1
20

Meng, C., Mo, X., Liu, S., and Hu, S. (2023). “Improving near-real-time satellite precipitation products through multistage modified schemes.” Atmospheric Research, Vol. 292, 106875.

10.1016/j.atmosres.2023.106875
21

Nguyen, G.V., Le, X.H., Van, L.N., Jung, S., and Lee, G. (2023). “Machine learning approaches for reconstructing gridded precipitation based on multiple source products.” Journal of Hydrology: Regional Studies, Vol. 48, 101475.

10.1016/j.ejrh.2023.101475
22

Nguyen, P., Dao, V., Ung, T., Arellano, C.J., Hsu, K., Sorooshian, S., Aghakouchak, A., Huffman, G.J., and Ralph, F.M. (2026). “PERSIANN-U-Net: A global deep learning framework for near-real-time precipitation estimation using infrared data.” Journal of Hydrometeorology, Vol. 27, No. 4, pp. 597-615.

10.1175/JHM-D-25-0162.1
23

Shen, Y., Zhao, P., Pan, Y., and Yu, J. (2014). “A high spatiotemporal gauge-satellite merged precipitation analysis over China.” Journal of Geophysical Research: Atmospheres, Vol. 119, No. 6, pp. 3063-3075.

10.1002/2013JD020686
24

Shen, Z., Yong, B., Gourley, J.J., and Qi, W. (2021). “Real-time bias adjustment for satellite-based precipitation estimates over Mainland China.” Journal of Hydrology, Vol. 596, 126133.

10.1016/j.jhydrol.2021.126133
25

Shi, J., Yuan, F., Shi, C., Zhao, C., Zhang, L., Ren, L., Zhu, Y., Jiang, S., and Liu, Y. (2020). “Statistical evaluation of the latest GPM-era IMERG and GSMaP satellite precipitation products in the Yellow River source region.” Water, Vol. 12, No. 4, 1006.

10.3390/w12041006
26

Tan, J., Huffman, G.J., Bolvin, D.T., and Nelkin, E.J. (2019). “Diurnal cycle of IMERG V06 precipitation.” Geophysical Research Letters, Vol. 46, No. 22, pp. 13584-13592.

10.1029/2019GL085395
27

Tang, G., Clark, M.P., Papalexiou, S.M., Ma, Z., and Hong, Y. (2020). “Have satellite precipitation products improved over last two decades? A comprehensive comparison of GPM IMERG with nine satellite and reanalysis datasets.” Remote Sensing of Environment, Vol. 240, 111697.

10.1016/j.rse.2020.111697
28

Ushio, T., Sasashige, K., Kubota, T., Shige, S., Okamoto, K., Aonashi, K., Inoue, T., Takahashi, N., Iguchi, T., Kachi, M., Oki, R., Morimoto, T., and Kawasaki, Z.-I. (2009). “A Kalman filter approach to the Global Satellite Mapping of Precipitation (GSMaP) from combined passive microwave and infrared radiometric data.” Journal of the Meteorological Society of Japan. Vol. 87A, pp. 137-151.

10.2151/jmsj.87A.137
29

Wang, S., Zhang, K., Chao, L., Li, D., Tian, X., Bao, H., Chen, G., and Xia, Y. (2021). “Exploring the utility of radar and satellite-sensed precipitation and their dynamic bias correction for integrated prediction of flood and landslide hazards.” Journal of Hydrology, Vol. 603, 126964.

10.1016/j.jhydrol.2021.126964
30

Wei, L., Jiang, S., Ren, L., Zhang, L., Wang, M., Liu, Y., and Duan, Z. (2022). “Bias correction of GPM IMERG Early Run daily precipitation product using near real-time CPC global measurements.” Atmospheric Research, Vol. 279, 106403.

10.1016/j.atmosres.2022.106403
31

Xie, P., and Xiong, A.Y. (2011). “A conceptual model for constructing high-resolution gauge-satellite merged precipitation analyses.” Journal of Geophysical Research: Atmospheres, Vol. 116, D21106.

10.1029/2011JD016118
32

Yin, Y., Chen, H., Wang, G., Xu, W., Wang, S., and Yu, W. (2021). “Characteristics of the precipitation concentration and their relationship with the precipitation structure: A case study in the Huai River basin, China.” Atmospheric Research, Vol. 253, 105484.

10.1016/j.atmosres.2021.105484
33

Zeng, Q., Chen, H., Xu, C.Y., Jie, M.X., Chen, J., Guo, S.L., and Liu, J. (2018). “The effect of rain gauge density and distribution on runoff simulation using a lumped hydrological modelling approach.” Journal of Hydrology, Vol. 563, pp. 106-122.

10.1016/j.jhydrol.2018.05.058
34

Zhang, L., Li, X., Zheng, D., Zhang, K., Ma, Q., Zhao, Y., and Ge, Y. (2021). “Merging multiple satellite-based precipitation products and gauge observations using a novel double machine learning approach.” Journal of Hydrology, Vol. 594, 125969.

10.1016/j.jhydrol.2021.125969
35

Zhang, Y., Ye, A., Nguyen, P., Analui, B., Sorooshian, S., and Hsu, K. (2022). “QRF4P-NRT: Probabilistic post-processing of near-real-time satellite precipitation estimates using quantile regression forests.” Water Resources Research, Vol. 58, e2022WR032117.

10.1029/2022WR032117
36

Zhou, L., Koike, T., Takeuchi, K., Rasmy, M., Onuma, K., Ito, H., Selvarajah, H., Liu, L., Li, X., and Ao, T. (2022). “A study on availability of ground observations and its impacts on bias correction of satellite precipitation products and hydrologic simulation efficiency.” Journal of Hydrology, Vol. 610, 127595.

10.1016/j.jhydrol.2022.127595
37

Zhou, T., Nijssen, B., Huffman, G.J., and Lettenmaier, D.P. (2014). “Evaluation of real-time satellite precipitation data for global drought monitoring.” Journal of Hydrometeorology, Vol. 15, No. 4, pp. 1651-1660.

10.1175/JHM-D-13-0128.1
38

Zounemat-Kermani, M., Batelaan, O., Fadaee, M., and Hinkelmann, R. (2021). “Ensemble machine learning paradigms in hydrology: A review.” Journal of Hydrology, Vol. 598, 126266.

10.1016/j.jhydrol.2021.126266
페이지 상단으로 이동하기