文章目录
矿机到场先别急着上架:散热、供电、维修件和验收流程要一起看
矿机硬件这件事,很多人买的时候盯着算力、功耗、单 T 成本,等机器真到场了,才发现真正影响回本的往往不是宣传页上的那几个参数,而是更琐碎的东西:风道有没有堵,电源线压接牢不牢,电源板有没有暗病,控制板固件能不能稳定识别,维修件有没有提前备好。
尤其现在矿场运维节奏比过去紧很多。行情一波动,机器调频、切池、降功耗、转场都可能同时发生;天气一热,散热余量马上被吃掉;供电稍微不稳,表现出来可能不是直接断电,而是掉板、低算力、反复重启、算力曲线像锯齿一样。真到这种时候,再去临时找备件、临时排线、临时喊维修,停机损失会比想象中更难看。
今天这篇不聊芯片路线,也不聊谁家参数更漂亮,只把矿机硬件落到现场:新机、二手机、返修机到场之后,散热、供电、维修、备件、验收到底应该怎么一起做。
验收别只看外观,先把“能不能稳定跑”拆成几项
矿机验收最容易犯的错,是把“能开机、有算力”当成通过。实际上,能亮灯、能联网、能跑出短时间算力,只能说明机器没有马上死机,并不能证明这台机器适合进场长期运行。
到场第一步,外观检查当然要做,但不能停在外壳有没有磕碰。风扇叶片是否变形,风扇框有没有松动,进出风口有没有灰尘团,电源接口有没有烧蚀痕迹,算力板固定螺丝有没有缺失,控制板接口有没有氧化,这些都要看。二手机尤其要注意维修痕迹,散热片是否重新打胶,板边是否有焊接返修,电源外壳是否有拆装痕迹。
第二步是通电前检查。很多矿场为了赶时间,机器一到就直接上架开机,这很危险。电源线规格、插头温升、PDU 负载、空开容量、接地情况,都要先确认。矿机不是普通家电,启动瞬间和持续满载都会给供电系统压力。如果线路本身有问题,机器开起来之后可能一开始没事,跑几个小时以后才开始出现接口发烫、跳闸、掉电。
第三步才是上电测试。这里不要只看 5 分钟算力,最好至少跑一个完整温升周期。机器从冷机到热稳定,中间会暴露不少问题:某块板温度上升过快、某个风扇转速异常、电源输出不稳、哈希板识别反复变化、错误率偏高。短测看不出来的毛病,往往在这个阶段出现。
散热不是风扇越猛越好,关键是风能不能走对路
矿机散热最怕的是“看着风很大,实际热出不去”。现场经常能见到这种情况:风扇转速很高,噪音也大,后台温度却压不住;有些机器前排还行,后排温度明显偏高;同一批机器里,有几台总是掉算力,拆开一看不是芯片坏,而是风道被灰尘、线缆、挡板影响了。
散热要看三个层面。
第一是机器内部风道。风扇、散热片、导风结构必须完整,不能有松动。二手机或返修机要特别留意散热片贴合,有些板子经过维修后,散热片位置看着没问题,但接触不好,跑起来局部温度会很快上去。后台显示的平均温度不一定能反映局部热点,所以一旦出现某块板频繁报错,不能只靠调高风扇解决。
第二是机架风道。矿场上架时,冷热风不能混在一起。热风回流是夏季掉算力的常见原因。前后排距离、挡风板、负压设计、排风通道,都比单独给某台机器加风扇更重要。很多人喜欢在局部加工业风扇,但如果热风没有被带走,只是在现场搅动,机器吸进去的还是热空气。
第三是灰尘和湿度。灰尘会降低散热效率,还会增加风扇负担。潮湿环境下,灰尘附着更严重,板卡氧化风险也更高。清灰不能等到机器报警才做,应该按照场地条件设周期。干燥多尘的地方,重点看进风过滤和风扇轴承;潮湿区域,重点看板卡腐蚀、接口氧化和电源内部积尘。
有个小矿场曾经遇到过一批机器夏天持续低算力,后台看温度并不夸张,维修人员一开始怀疑板卡老化。后来现场排查发现,问题出在机架后方热风排不出去,热风从侧面回流到进风口,机器一直吸“二手热风”。调整挡风和排风之后,不换板、不换风扇,算力曲线反而稳了下来。
供电问题最会伪装成硬件故障
矿机维修里,供电问题很容易被误判。掉板、重启、算力波动、风扇异常、控制板离线,看上去都像机器坏了,但源头可能是电压波动、接触不良、线材发热、PDU 负载不均,甚至是某一路空开长期接近上限。
供电验收要从整条链路看,不要只看电源模块本身。变压器容量、配电柜、空开、线径、PDU、插头、矿机电源,每一段都有可能成为瓶颈。尤其是高功耗机器集中上架时,不能按理论总功率压满,必须留余量。现场环境温度升高之后,线材和接头温升会更明显,原本勉强能跑的配置,到了夏天可能就开始出问题。
电源线和接口是重点。接口轻微发黑、塑料件变色、插头松动、线缆发硬,都不是小事。矿机长时间满载运行,接触电阻稍微变大,就会持续发热。很多烧插头、烧 PDU 的事故,前期都有温升异常,只是没人记录。
还有一个容易被忽视的点:同一排机器不要只看总负载,要看三相是否平衡。三相不平衡会让某一路长期吃重,带来额外风险。对于新到一批机器,最好在上架后做一次负载复核,确认每一路电流、电压和温升,而不是等跳闸之后再倒查。
维修不能只靠师傅经验,要把常见故障做成分层判断
矿机坏了之后,现场最忌讳的是盲目拆板。拆一次就多一次人为风险,排线、接口、螺丝、散热片都有可能被二次损伤。更稳妥的方式,是先把故障分层。
如果是整机不通电,先查外部电源、线缆、PDU、空开,再查电源模块,不要一上来就怀疑控制板。
如果是能开机但不出算力,先查网络、矿池配置、控制板识别,再看算力板。
如果是单板掉线,先换位置、换排线、看温度和错误率,再判断是否板卡故障。
如果是运行一段时间后掉算力,优先看温度、电源输出和风扇状态,不要只盯芯片。
如果是反复重启,供电波动、固件异常、控制板故障都要排查,不能只换电源试运气。
维修记录也很重要。一台机器换过什么板、什么时间换、故障现象是什么、修完后跑了多久、是否复发,都应该记录。没有维修记录的矿场,后面会越来越乱:同一台机器反复修,备件消耗说不清,问题批次也追不出来。
返修机回场后,不要直接混入正常机群。至少要单独跑一段观察期,确认温度、错误率、算力稳定性,再上生产架。否则返修机如果存在间歇性故障,会拖累整个排查效率。
备件不是越多越好,要按停机损失来配
备件管理看起来是后勤问题,其实直接影响矿场收益。没有备件,坏一台等一台;备件太乱,占钱、占库房,还可能因为型号不匹配用不上。
矿场最基础的备件,一般要覆盖风扇、电源、控制板、常用排线、网线、PDU 易损件、螺丝和少量关键板卡。风扇属于高频损耗件,尤其灰尘大、温度高的场地,要备足。电源故障对停机影响大,也应该按机型准备一定比例。控制板损坏率未必最高,但一旦没有替换件,排查会很被动。
备件比例不能照搬别人,要看自己的机器数量、机型集中度、场地环境和维修响应时间。如果矿场离维修点近,备件比例可以适当低一些;如果场地偏远、物流慢,就必须提高关键件库存。二手机占比高的矿场,也要比新机矿场多准备一些风扇、电源和板卡。
更关键的是备件也要验收。很多人把拆下来的件随手放进“备件箱”,过几个月拿出来用,才发现本来就是坏的。备件应该分状态:全新、良品、待测、故障件,不能混放。良品件要贴标签,写清来源、测试时间、适配机型。故障件及时返修或报废,不要在库房里反复污染判断。
一套能落地的到场流程,比临时经验更值钱
矿机到场验收可以做得很复杂,但现场真正需要的是可执行。建议把流程压成几步:收货拍照、外观检查、通电前供电确认、单机短测、分组满载测试、温升记录、异常隔离、入库或上架。
新机重点看批次一致性和运输损伤;二手机重点看维修痕迹、灰尘、接口、温度表现;返修机重点看故障是否复发。不同来源的机器不要混在一起验收,否则出了问题很难追。
验收时至少保留三类记录:机器编号和来源,测试时的算力与温度,发现的问题和处理结果。记录不需要写得很花,但要能追溯。以后某一批机器集中掉板,或者某一种电源频繁出问题,靠这些记录才能快速判断是批次问题、环境问题还是运维问题。
最后给矿机硬件运维几个具体建议:
第一,新机器到场不要急着满架投产,先留出测试区,跑过温升周期再进生产区。
第二,散热检查不要只看后台温度,要看风道、热风回流、灰尘和局部异常。
第三,供电系统至少每次大批量上架后复核一次负载和温升,尤其注意插头、PDU 和三相平衡。
第四,维修先分层判断,少盲拆,多记录,返修机必须单独观察。
第五,备件按停机损失配置,不要只看价格;风扇、电源、控制板和常用线材要有清晰状态标签。
矿机硬件的稳定,不是某一个零件决定的,而是散热、供电、维修、备件和验收一起撑起来的。行情好的时候,少停一小时就是多一小时收益;行情弱的时候,少一次误判、少一次返修、少一批故障扩散,就是在给现金流减压。真正成熟的矿场,不会等机器坏了才重视硬件管理,而是在机器进场第一天,就把这些细节管起来。
