TY - GEN
T1 - Accuracy-Aware Log Replay with Fine-Grained Prioritization for Real-Time Prediction Queries
AU - Huang, Shanshan
AU - Jiang, Jing
AU - Cai, Peng
AU - Dong, Qiwen
AU - Hu, Huiqi
N1 - Publisher Copyright:
© The Author(s), under exclusive license to Springer Nature Singapore Pte Ltd. 2026.
PY - 2026
Y1 - 2026
N2 - Machine learning applications require timely access to fresh data from primary–backup databases to ensure accurate inference. Existing log replay strategies treat all updates equally and adhere to log-order dependencies, or only prioritize frequently accessed tables, resulting in high latency for prediction queries that usually access a small subset of attributes. Allowing immediate query execution can reduce latency but risks substantial accuracy degradation, as prediction models exhibit varying sensitivity even to minor data staleness. In this paper, we propose AALR, an accuracy-aware log replay strategy that accelerates data visibility for prediction queries while preserving inference accuracy. AALR prioritizes replay at the attribute level, enabling fine-grained replay aligned with query access patterns to avoid unnecessary delay. It leverages a learning-based model to quantify the relationship between data freshness and prediction accuracy, supporting adaptive replay decisions under diverse workloads. Furthermore, AALR introduces an epoch-based two-step replay mechanism, combining column-level parallel classification with row-level latest transaction retention to improve parallelism and resource utilization. Extensive experiments on multiple real-world datasets demonstrate that AALR significantly reduces data visibility latency for prediction queries while maintaining high prediction accuracy, outperforming state-of-the-art log replay strategies.
AB - Machine learning applications require timely access to fresh data from primary–backup databases to ensure accurate inference. Existing log replay strategies treat all updates equally and adhere to log-order dependencies, or only prioritize frequently accessed tables, resulting in high latency for prediction queries that usually access a small subset of attributes. Allowing immediate query execution can reduce latency but risks substantial accuracy degradation, as prediction models exhibit varying sensitivity even to minor data staleness. In this paper, we propose AALR, an accuracy-aware log replay strategy that accelerates data visibility for prediction queries while preserving inference accuracy. AALR prioritizes replay at the attribute level, enabling fine-grained replay aligned with query access patterns to avoid unnecessary delay. It leverages a learning-based model to quantify the relationship between data freshness and prediction accuracy, supporting adaptive replay decisions under diverse workloads. Furthermore, AALR introduces an epoch-based two-step replay mechanism, combining column-level parallel classification with row-level latest transaction retention to improve parallelism and resource utilization. Extensive experiments on multiple real-world datasets demonstrate that AALR significantly reduces data visibility latency for prediction queries while maintaining high prediction accuracy, outperforming state-of-the-art log replay strategies.
KW - Data Freshness
KW - Machine Learning
KW - Parallel Log Replay
KW - Real-time Prediction
UR - https://www.scopus.com/pages/publications/105040529842
U2 - 10.1007/978-981-92-0366-6_34
DO - 10.1007/978-981-92-0366-6_34
M3 - 会议稿件
AN - SCOPUS:105040529842
SN - 9789819203659
T3 - Lecture Notes in Computer Science
SP - 561
EP - 577
BT - Database Systems for Advanced Applications - 31st International Conference, DASFAA 2026, Proceedings
A2 - Jung, Hyungsoo
A2 - Wang, Tianzheng
A2 - Toyoda, Masashi
A2 - Kwon, Hyuk-Yoon
A2 - Lee, Jae-woong
PB - Springer Science and Business Media Deutschland GmbH
T2 - 31st International Conference on Database Systems for Advanced Applications, DASFAA 2026
Y2 - 27 April 2026 through 30 April 2026
ER -