Redis持久化機制_ZenDei技術網路在線

Redis持久化機制

-Advertisement-

1、Redis數據持久化的必要性由於redis是基於記憶體的資料庫，面臨數據掉電易失的風險，要避免數據丟失，最好將記憶體數據持久化到磁碟等永久存儲介質上。服務重啟時，會先載入磁碟文件內的數據到記憶體，完成數據恢復。 2、RDB（RedisDB）對記憶體中的redis全量數據進行時點快照並序列化，以文 ...

1、Redis數據持久化的必要性

由於redis是基於記憶體的資料庫，面臨數據掉電易失的風險，要避免數據丟失，最好將記憶體數據持久化到磁碟等永久存儲介質上。服務重啟時，會先載入磁碟文件內的數據到記憶體，完成數據恢復。

2、RDB（RedisDB）

對記憶體中的redis全量數據進行時點快照並序列化，以文件形式保存到磁碟上，生成的是dump.rdb二進位文件。到了dump時間點就生成一份新的rdb文件，同時覆蓋掉舊的。服務重啟時直接將dump文件反序列化並載入到記憶體中，數據恢復速度較快，也是redis預設的持久化方式。hdfs的nameNode也是用類似的方式生成fsimage文件來做持久化的，hdfs的nameNode也是用類似的方式生成fsimage文件來做持久化的

執行方式：

阻塞式：

類似JVM的stop-the-world，做快照的時候不能處理客戶端請求，客戶端可以使用save命令觸發。優點原理簡單，能保證數據一致性，缺點是對用戶不友好。

非阻塞式：

服務端做數據快照的時候，可以繼續處理客戶端的請求，客戶端可以使用bgsave命令觸發。優點是對客戶端友好，但複雜度高，必須解決做快照的同時，併發寫操作造成的數據不一致問題。
redis中的所有key和value是分為兩個部分單獨存儲的，兩個數據區之間建立映射關係，數據修改只是映射關係的改變。
大體機制：當服務端接收到bgsave命令後，服務端不會立馬執行快照操作，而是選擇合適的時機fork一個子進程，這個子進程全量繼承父進程的key數據集和映射關係。實現類cow的效果，子進程只保證dump時點當前的數據一致性，至於併發修改的數據就交給下一次dump來持久化。

配置策略：

可以通過客戶端發命令的方式，也可以寫在配置文件中實現自動持久化。
save 900 1 //如果在900秒內發生了超過1次k-v更新就觸發一次dump
save 300 10 //如果在300秒內發生了超過10次k-v更新就觸發一次dump
save 60 10000 //如果在60秒內發生了超過1萬次k-v更新就觸發一次dump
dbfilename dump.rdb //快照文件名
dir /opt/redis/rep //快照存儲路徑
【每完成一次快照後，時間計和更新計數器都會清零】

優點：

全量備份，可以做到針對不同時間點的多版本恢復（此時需要避免覆蓋問題，推薦用多伺服器來存儲dump文件）。
備份文件緊湊單一，利於網路傳輸，適合災難恢復。
恢復大數據集速度比AOF快。

缺點：

最後一次快照時如果掉電，併發寫的數據將丟失，所以適合存儲能容忍這種風險的場合。
fork過程會造成毫秒級的耗時，會造成短暫的拒絕相應。

3、AOF（AppendOnlyFile）

實時記錄每一條寫數據的命令，形成binlog，服務重啟時會原樣執行一遍aof文件中的所有命令，達到數據恢復的目的，但恢復速度比rdb式慢。hdfs中提供了類似的方式，edit-log，只是預設時關閉的。

幾乎可以做到不丟失任何數據，也可以控制丟失一秒內的數據。
備份的數據量太大，不夠緊湊，io交互頻繁。
寫入機制：在現代操作系統中，程式執行write系統調用時，是先將數據寫到一個記憶體buffer中，等到buffer滿或者用戶執行fsync或fdatasync
指令時才會將buffer數據刷到disc上，所以未刷盤的數據存在掉電丟失風險。

落盤策略由appendfssync選項控制：

always：服務端每接收一個更新指令都刷到磁碟，不會發生數據丟失，但是io太過頻繁效率很低。
everysecond：每隔1秒鐘刷一次盤，有可能丟失一秒鐘的數據，效率適中。
no：服務端不主動刷盤，數據何時落盤完全取決於操作系統，只有當buffer滿了才會刷盤，丟失數據量不確定，效率最高。

AOF重寫機制：

由於AOF文件時間長了會很大，可以通過分析文件內容，將多條命令合併為一條，將對同一個key的多次操作只保留最新的那一次。

AOF重寫過程

fork一個子進程負責重寫AOF文件
子進程創建一個臨時文件來寫入AOF數據
父進程開闢一個記憶體緩衝區接收新的寫命令
子進程重寫完畢後，父進程會獲得一個信號，父進程將新收到的寫命令通過子進程寫入臨時文件
用臨時文件替換掉舊的AOF文件

AOF重寫的觸發

手動式：通過客戶端發送bgrewriteaof命令。
自動式：必須在配置文件中配置如下兩個參數
- auto-aof-rewrite-min-size 500mb //只有當aof文件大於等於500M時，伺服器才會重寫aof文件，避免過小文件的重寫問題。
- auto-aof-rewrite-min-percentage 60 //在滿足最小閾值的前提下，超過上一次重寫後生成的文件體積的60%時將觸發重寫，避免了無限迴圈重寫。（如果尚未做過重寫，就以啟動時的AOF文件體積作為對比基準，如果此值為0，則表示關閉自動重寫功能）。

優點：

預設每秒刷盤，性能好不阻塞服務，最多丟失一秒數據。
如果發生誤操作（flushall等），只要文件未被重寫，立即停止服務將，AOF文件最後的flushall命令刪除，然後重啟redis服務實現數據恢復。

缺點：

相同數據集，AOF比RDB大很多。
數據恢復速度比RDB慢。

您的分享是我們最大的動力!

-Advertisement-

更多相關文章

電腦操作系統概述2

操作系統控制電腦電腦系統操作方式 OS規定了合理操作電腦的工作流程，OS的操作介面——系統程式，OS提供給用戶的功能級介面，為用戶提供的解決操作電腦和計算共性問題的所有服務的集合，OS的兩類作業級介面：離線作業控制方式，作業控制語言；聯機作業控制方式，操作控制命令離線作業控制方式 + O ...
linux 查看系統資源使用信息的一些命令集合

linux上的進程查看及管理工具： pstree，ps，pidof，pgrep，top，htop，glances，pmap，vmstat，dstat，kill，pkill，job，bg，fg，nohup，nice，renice，killall。。。 linux開機時，會啟動第一個進程，由這個進程去啟 ...
MySQL導出數據時提示文件損壞

1. 使用Navicat工具，優先將整個資料庫的表和數據導出。 2. 如果遇到文件損壞錯誤可以在表實例界面選中所有表，然後將表轉儲為SQL文件（結構和數據）。 3. 在目標資料庫執行導出的SQL文件，導入數據和結構。 4. 如果個別表因為各種原因（比如使用federated引擎建立了DB L ...
Flink知識散點

1、KeyBy 操作後，只有當 Key 的數量大於運算元的併發實例數才能獲得較好的計算性能。 A.而若Key 的數量比實例數量少，就會導致部分實例收不到數據，這些實例就得不到執行，這些實例的計算能力得不到充分發揮。 ~~B.當Key個數多餘並行實例數時，由於同一個 Key 對應的所有數據都能發送到同一 ...
Flink中邏輯計劃和物理計劃的概念劃分和對應關係

邏輯計劃 1. logicGraph或者jobGraph，其端點為operator，edge為數據流向。 2. operator往往代表一個函數。 3. 同一個分區內的具有連續上下游關係的函數組成operator chain，一個operator chain內的數據來流動過程中不會出現序列化和分區間 ...
SparkShuffle機制

在早期版本的Spark中，shuffle過程沒有磁碟讀寫操作，是純記憶體操作，後來發現效率較低，且極易引發OOME，較新版本的Shuffle操作都加入了磁碟讀寫進行了改進。 1、未經優化的HashShuffleManager：上一個stage中每一個task會對下一個stage的每一個task寫一份數 ...
Spark組件間通信

1、Spark組件之間使用RPC機制進行通信。RPC的客戶端在本地編寫並調用業務介面，介面在本地通過RPC框架的動態代理機制生成一個對應的實現類，在這個實現類中完成soket通信、遠程調用等功能的邏輯包裝，而在RPC的服務端既編寫業務介面也編寫了具體的業務實現類，通過RPC框架以介面的方式暴露出來， ...
Spark記憶體管理

1、spark的一大特性就是基於記憶體計算，Driver只保存任務的巨集觀性的元數據，數據量較小，且在執行過程中基本不變，不做重點分析，而真正的計算任務Task分佈在各個Executor中，其中的記憶體數據量大，且會隨著計算的進行會發生實時變化，所以Executor的記憶體管理才分析的重點。 2、在執行Sp ...