Golang 獲取文件md5校驗(yàn)的方法以及效率對比
近期有一個(gè)需求:獲取多個(gè)文件 md5 校驗(yàn)和判斷是否存在重復(fù)文件,因?yàn)槲募?shù)量較多,有的文件還比較大,需要處理的文件還沒有到位,我就考慮了一下效率的問題。
目前我已知的 Golang 中獲取 md5 校驗(yàn)和的方法有兩個(gè)
這里直接給出實(shí)現(xiàn)源碼。
package main import ( "crypto/md5" "flag" "fmt" "io" "io/ioutil" "os" ) var which = flag.Bool("which", true, "") var path = flag.String("path", "", "") var cnt = flag.Int("cnt", 100, "") func aaa() { f, err := os.Open(*path) if err != nil { fmt.Println("Open", err) return } defer f.Close() body, err := ioutil.ReadAll(f) if err != nil { fmt.Println("ReadAll", err) return } md5.Sum(body) //fmt.Printf("%x\n", md5.Sum(body)) } func bbb() { f, err := os.Open(*path) if err != nil { fmt.Println("Open", err) return } defer f.Close() md5hash := md5.New() if _, err := io.Copy(md5hash, f); err != nil { fmt.Println("Copy", err) return } md5hash.Sum(nil) //fmt.Printf("%x\n", md5hash.Sum(nil)) } func main() { flag.Parse() for i := 0; i < *cnt; i++ { if *which { aaa() } else { bbb() } } }
還有可供參考的獲取 md5 校驗(yàn)和的 Shell 命令
md5 -- calculate a message-digest fingerprint (checksum) for a file md5 [-pqrtx] [-s string] [file ...]
測試文件是公司項(xiàng)目的日志文件
banjakukutekiiMac:shell panshiqu$ ls -an | grep by -rw-r--r-- 1 501 20 7285957 11 17 16:14 by.out banjakukutekiiMac:shell panshiqu$ cp by.out by2.out banjakukutekiiMac:shell panshiqu$ cat by.out >> by2.out banjakukutekiiMac:shell panshiqu$ ls -an | grep by -rw-r--r-- 1 501 20 7285957 11 17 16:14 by.out -rw-r--r-- 1 501 20 14571914 11 17 17:03 by2.out
下面效率展示
banjakukutekiiMac:shell panshiqu$ time ./gomd5 -cnt=1 -which=true -path="by.out" real 0m0.027s user 0m0.017s sys 0m0.012s banjakukutekiiMac:shell panshiqu$ time ./gomd5 -cnt=1 -which=true -path="by2.out" real 0m0.048s user 0m0.033s sys 0m0.018s banjakukutekiiMac:shell panshiqu$ time ./gomd5 -cnt=1 -which=false -path="by.out" real 0m0.018s user 0m0.012s sys 0m0.004s banjakukutekiiMac:shell panshiqu$ time ./gomd5 -cnt=1 -which=false -path="by2.out" real 0m0.031s user 0m0.024s sys 0m0.005s banjakukutekiiMac:shell panshiqu$ time md5 by.out MD5 (by.out) = 9d79e19a00cef1ae1bb6518ca4adf9de real 0m0.023s user 0m0.019s sys 0m0.006s banjakukutekiiMac:shell panshiqu$ time md5 by2.out MD5 (by2.out) = 0a029a460a20e8dcb00d032d6fab74c6 real 0m0.042s user 0m0.037s sys 0m0.009s
總結(jié):
不管什么方法都會(huì)隨著文件變大時(shí)間會(huì)變長,上面的例子大約都是2倍
io.Copy 方法效率最高,建議大家這樣使用
補(bǔ)充:Go語言:md5計(jì)算方法的效率研究
研究了一下Go的md5計(jì)算方法,目前來看,效率最高運(yùn)行最快的寫法是調(diào)用md5.Sum()函數(shù)返回16字節(jié)checksum,然后把每個(gè)字節(jié)的高4位和低4位分別映射成16進(jìn)制字符存到兩個(gè)字節(jié)里,得到32字節(jié),再轉(zhuǎn)成字符串。
FastMD5較其它算法效率提高了至少46%以上。
const hextable = "0123456789abcdef" //作者: pengpengzhou func FastMD5(str string) string { src := md5.Sum([]byte(str)) var dst = make([]byte, 32) j := 0 for _, v := range src { dst[j] = hextable[v>>4] dst[j+1] = hextable[v&0x0f] j += 2 } return string(dst) }
Go Test Benchmark測試結(jié)果:
goos: linux goarch: amd64 pkg: example BenchmarkFastMD5-4 5564898 205 ns/op BenchmarkV1-4 3461698 379 ns/op BenchmarkV2-4 2277235 516 ns/op BenchmarkV3-4 2158122 527 ns/op PASS ok example 6.440s
詳細(xì)代碼如下:
package main import ( "crypto/md5" "encoding/hex" "fmt" "io" ) const hextable = "0123456789abcdef" func FastMD5(str string) string { src := md5.Sum([]byte(str)) var dst = make([]byte, 32) j := 0 for _, v := range src { dst[j] = hextable[v>>4] dst[j+1] = hextable[v&0x0f] j += 2 } return string(dst) } func md5V1(str string) string { h := md5.New() h.Write([]byte(str)) return hex.EncodeToString(h.Sum(nil)) } func md5V2(str string) string { data := []byte(str) has := md5.Sum(data) md5str := fmt.Sprintf("%x", has) return md5str } func md5V3(str string) string { w := md5.New() io.WriteString(w, str) md5str := fmt.Sprintf("%x", w.Sum(nil)) return md5str } func main() { str := "中文" fmt.Println(FastMD5(str)) fmt.Println(md5V1(str)) fmt.Println(md5V2(str)) fmt.Println(md5V3(str)) }
package main import ( "testing" ) var str = "golang中文教程" func BenchmarkFastMD5(b *testing.B) { for i := 0; i < b.N; i++ { FastMD5(str) } } func BenchmarkV1(b *testing.B) { for i := 0; i < b.N; i++ { md5V1(str) } } func BenchmarkV2(b *testing.B) { for i := 0; i < b.N; i++ { md5V2(str) } } func BenchmarkV3(b *testing.B) { for i := 0; i < b.N; i++ { md5V3(str) } }
以上為個(gè)人經(jīng)驗(yàn),希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教。
相關(guān)文章
golang?防緩存擊穿singleflight的實(shí)現(xiàn)
本文主要介紹了golang?防緩存擊穿singleflight的實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2022-08-08Go語言RPC Authorization進(jìn)行簡單ip安全驗(yàn)證的方法
這篇文章主要介紹了Go語言RPC Authorization進(jìn)行簡單ip安全驗(yàn)證的方法,實(shí)例分析了Go語言進(jìn)行ip驗(yàn)證的技巧,需要的朋友可以參考下2015-03-03輕松入門:使用Golang開發(fā)跨平臺(tái)GUI應(yīng)用
Golang是一種強(qiáng)大的編程語言,它的并發(fā)性和高性能使其成為開發(fā)GUI桌面應(yīng)用的理想選擇,Golang提供了豐富的標(biāo)準(zhǔn)庫和第三方庫,可以輕松地創(chuàng)建跨平臺(tái)的GUI應(yīng)用程序,通過使用Golang的GUI庫,開發(fā)人員可以快速構(gòu)建具有豐富用戶界面和交互功能的應(yīng)用程序,需要的朋友可以參考下2023-10-10在 Golang 中實(shí)現(xiàn) Cache::remember 方法詳解
這篇文章主要介紹了在 Golang 中實(shí)現(xiàn) Cache::remember 方法詳解,本文給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2021-03-03Golang?rabbitMQ生產(chǎn)者消費(fèi)者實(shí)現(xiàn)示例
這篇文章主要為大家介紹了Golang?rabbitMQ生產(chǎn)者消費(fèi)者實(shí)現(xiàn)的示例,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步早日升職加薪2022-04-04