
【Bug已解决】Using numpy2.0.0 解决方案一、现象长什么样把环境的numpy升到2.0.0后原本跑得好好的 Transformers / Tokenizers / 训练脚本开始报一堆AttributeErrorimport numpy as np from transformers import AutoTokenizer tok AutoTokenizer.from_pretrained(bert-base-uncased) ids tok(hello world, return_tensorsnp)[input_ids] print(ids.dtype)报错AttributeError: module numpy has no attribute int. Did you mean: inf?或者AttributeError: module numpy has no attribute bool AttributeError: module numpy has no attribute float AttributeError: module numpy has no attribute object也可能不报错但行为变np.array([1,2,3]).tolist()没问题但某些代码靠np.int做类型标注、靠np.bool做 dtype 比较时静默拿错类型下游np.array(..., dtypenp.int)直接炸。最迷惑的是报错出现在「你没改过的第三方库」里tokenizers、transformers 的某个modeling_xxx、或者你自己的数据预处理脚本你只升了 numpy没动代码于是满屏AttributeError不知道从哪修。二、背景NumPy 2.0 做了一个大清理删除了大量 Python 内置类型的别名。这些别名长期被标为 deprecated2.0 直接移除旧写法已删正确替代np.intint/np.int64np.floatfloat/np.float64np.boolbool/np.bool_np.objectobject/np.object_np.strstr/np.str_np.longint/np.int64np.unicodestr/np.str_很多老代码包括一些尚未来得及适配 NumPy 2.0 的库版本里写的是dtypenp.int/np.array(x, dtypenp.bool)。在 NumPy 1.x 只是告警升到 2.0 直接AttributeError。另外 NumPy 2.0 还改了一些行为np.linalg默认更严格、copy语义变化、np.printoptions精度等但最普遍、最先炸的就是上面这批别名。三、根因根因一句话NumPy 2.0 移除了np.int/np.float/np.bool/np.object/np.str等 Python 类型别名而代码含第三方库仍用这些别名做 dtype/类型标注升级后直接AttributeError。三点展开别名被删np.int等不再存在任何引用立即AttributeError。散落多处不止你的脚本transformers/tokenizers/数据增强库里都可能藏着dtypenp.int类写法难以一处修完。缺兼容垫片没有一层「把旧别名映射到新名字」的兼容层升级即全线中招。不是模型问题是「NumPy API 契约」在升级后断裂。四、最小可运行复现不依赖真实库模拟别名移除import numpy as np # 模拟「升级到 numpy 2.0 后np.int 等别名被删」 for alias in [int, float, bool, object, str]: if not hasattr(np, alias): print(fnp.{alias} 不存在 - 旧代码会 AttributeError) # 旧写法 try: a np.array([1, 2, 3], dtypenp.int) # 2.0 下炸 print(旧写法 OK) except AttributeError as e: print(旧写法炸:, e) # 新写法 a np.array([1, 2, 3], dtypenp.int64) # 正确 b np.array([True, False], dtypenp.bool_) # 正确 print(新写法 dtype:, a.dtype, b.dtype)跑出来np.int等逐一报「不存在」旧dtypenp.int直接AttributeError改用np.int64/np.bool_后正常。这就是升 numpy 后满屏报错的精确复现。五、解决方案第一层最小直接修复最小修复把所有np.int/np.float/np.bool/np.object/np.str替换为正确的内置类型或 NumPy 2.0 名称。import numpy as np # 旧numpy 1.x 告警2.0 报错 # arr np.array([1, 2, 3], dtypenp.int) # mask np.array([True, False], dtypenp.bool) # 新numpy 1.x / 2.0 都兼容 arr np.array([1, 2, 3], dtypenp.int64) # 或用内置 int mask np.array([True, False], dtypenp.bool_) # 类型标注也改 def foo(x: int) - float: # 用内置不用 np.int / np.float return float(x) # 若第三方库内部仍用旧别名临时加兼容垫片仅应急 import numpy as _np for _old, _new in [(int, _np.int64), (float, _np.float64), (bool, _np.bool_), (object, _np.object_), (str, _np.str_)]: if not hasattr(_np, _old): setattr(_np, _old, _new)要点优先用 Python 内置int/float/bool/str/object它们和 NumPy 2.0 完全兼容且 1.x 也兼容。需要具体精度时用np.int64/np.float64/np.bool_/np.object_/np.str_。第三方库没适配时临时垫片可应急但长期应升级该库。这一步单独就让AttributeError消失。六、解决方案第二层结构性改进第一层是「逐个改别名」。但项目里散落很多处、且第三方库也有最好把「numpy 2.0 兼容」收敛成单一垫片模块集中映射且能一键开关/告警。from dataclasses import dataclass, field from typing import Dict import numpy as np dataclass class NumpyCompatShim: NumPy 2.0 别名的集中兼容层。 # 旧别名 - 新对象 _MAP: Dict[str, object] field(default_factorydict, initFalse, reprFalse) def __post_init__(self): self._MAP { int: np.int64, float: np.float64, bool: np.bool_, object: np.object_, str: np.str_, long: np.int64, unicode: np.str_, } def install(self, warn: bool True): 把缺失的别名补回 numpy 命名空间应急兼容。 for old, new in self._MAP.items(): if not hasattr(np, old): if warn: import warnings warnings.warn( f为兼容临时注册 np.{old}建议改代码用 {new.__name__}, DeprecationWarning, ) setattr(np, old, new) def check_usages(self, codebase_glob): 示意扫描代码里是否还有 np.int 等旧写法。 import subprocess, shlex pattern |.join(fnp\\.{k} for k in self._MAP) # 实际项目用 rg/grep 扫这里只返回 pattern 供 CI 使用 return pattern # 用法进程启动时 shim NumpyCompatShim() shim.install(warnTrue)结构收益集中映射所有别名替换规则在一处便于审计。可告警install(warnTrue)让每次应急注册都抛DeprecationWarning提醒你真去改代码。可扫描check_usages提供 pattern 给 CI 静态扫防止旧写法回潮。七、解决方案第三层断言 / CI 守护写 pytest 守两条(1) 代码里不再出现np.int等旧别名(2) 修复后 dtype 行为正确。import numpy as np import pytest from your_lib import NumpyCompatShim def test_no_legacy_aliases_in_codebase(): # CI 里用 rg 扫源码发现旧别名即失败 import subprocess pattern rnp\.(int|float|bool|object|str|long|unicode)\b try: out subprocess.run( [rg, -n, pattern, --glob, *.py, src/, --files-with-matches], capture_outputTrue, textTrue, ) except FileNotFoundError: pytest.skip(rg 未安装) assert out.stdout.strip() , f仍含旧 numpy 别名:\n{out.stdout} def test_dtype_works_on_numpy2(): arr np.array([1, 2, 3], dtypenp.int64) mask np.array([True, False], dtypenp.bool_) assert arr.dtype np.int64 assert mask.dtype np.bool_ def test_shim_registers_missing_aliases(): shim NumpyCompatShim() # 模拟 np.int 被删的场景 if hasattr(np, int): del np.int shim.install(warnFalse) assert hasattr(np, int) assert np.int is np.int64 def test_builtin_types_still_work(): # 优先用内置类型1.x/2.0 都兼容 a np.array([1, 2], dtypeint) assert a.dtype np.int64 or a.dtype np.int32CI 常驻跑这四条后任何「又写回 np.int」的回归都会立刻爆红。八、排查清单升 numpy 2.0 后满屏AttributeError时按顺序查先确认报错是不是module numpy has no attribute int/bool/float/object/str——是的话定位别名移除。全局搜np.int\b、np.float\b、np.bool\b、np.object\b、np.str\b逐处改成内置/np.int64等。类型标注里的np.int等也一并改用 Python 内置int/float/bool/str/object。第三方库tokenizers/transformers 旧版若仍用旧别名先升级该库紧急时用NumpyCompatShim垫片。确认不是只改了自己代码、漏了return_tensorsnp触发的库内部路径。注意np.bool→np.bool_np.object→np.object_带下划线别漏。升完后跑一次「tokenizer generate 训练」冒烟确认无AttributeError。九、小结升级numpy2.0.0后满屏AttributeError根子是 NumPy 2.0 移除了np.int/np.float/np.bool/np.object/np.str等 Python 类型别名而代码和第三方库仍用这些别名做 dtype/标注。修复三层次第一层把别名替换为内置类型或np.int64/np.bool_等第二层用NumpyCompatShimdataclass 集中映射并加DeprecationWarning告警、提供 CI 扫描 pattern第三层用 pytest 守「代码无旧别名」「dtype 行为正确」「垫片能补」「内置类型可用」。工程启示依赖numpy的项目类型标注和 dtype 一律用 Python 内置int/float/bool/str/object或带下划线的 NumPy 类型np.int64/np.bool_永远别用np.int这类历史别名。这不仅是 2.0 兼容也是消除 1.x 上 DeprecationWarning 的好习惯。