风险提示:理性看待区块链,提高风险意识!
币界网
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

哈佛MIT造出「黑客帝国」,83亿智能体精确镜像全球真实人类

摘要

如果你准备投胎,你大概率会降生在哪个国家? 会拥有怎样的职业、收入、价值观,乃至对一个APP按钮颜色的小小偏好? 在过去,要算清这串横跨社会学、行为经济学和心理学的概率,无数社会学家和统计学家要熬秃头...

哈佛MIT造出「黑客帝国」,83亿智能体精确镜像全球真实人类

如果你准备投胎,你大概率会降生在哪个国家?

会拥有怎样的职业、收入、价值观,乃至对一个APP按钮颜色的小小偏好?

在过去,要算清这串横跨社会学、行为经济学和心理学的概率,无数社会学家和统计学家要熬秃头。

1999年《黑客帝国》中科幻场景,刚刚成真了!

哈佛+MIT博士领衔、OpenAI、Anthropic、Google DeepMind、xAI等40余人参与、共200多位顶尖科学家,发布MatrAIx,构建83亿个智能体,模拟全世界人类真实行为。

在大模型王座争夺战里杀得刺刀见红的巨头们,这一次,竟然心照不宣地联手织造了一张网——一张囚禁了全人类行为的「数字之幕」。

论文:https://arxiv.org/abs/2608.04205

GitHub Repo:https://github.com/MatrAIx-ai/MatrAIx-Persona-8B

他们赋予AI智能体人格:

1、创建了覆盖全球人口规模的83亿条人物画像记录,涵盖背景、心理、能力、行为及生活方式等 1290 个维度。

2、支持在四种环境类型中进行人物画像智能体评估:问卷调查、AI 聊天机器人、网页和应用。

3、提供覆盖 25+领域、1000+项评估任务,涵盖商业、软件、金融和医疗健康。

传统用户研究员、产品经理的核心技能瞬间贬值。

同时,每个人都必须面对一个问题:

当你的「个性」只是1290个高维空间中自洽的概率分布时,你如何证明自己仍是不可被完全模拟的唯一?

AI算尽全人类性格!

产品经理的「奥本海默时刻」

传统的用户研究(User Research)在这一天,迎来了它的「奥本海默时刻」。

过去,科技巨头要推一款新应用、新策略,需要耗费数月、招募成百上千个不同肤色和背景的真实志愿者、进行无数次灰度测试和线下访谈。

在 MatrAIx的硅基世界里,这个高壁垒、高延迟、高成本的流程被压缩成了一瞬间。

Persona-8B数据库的规模为83亿,与此刻物理地球上的真实总人口,实现了一比一的精确镜像。

它们不需要交五险一金,却比你更懂得如何在macOS上优雅地拒绝一个糟糕的UI设计。

有了这83亿可以随时调遣的数字原住民,接下来要做的,就是把它们投放到社会生活中去。

MatrAIx团队为其量身定制了四个全通路的模拟交互环境,称之为MatrAIx Playground

调查问卷 (Surveys):测试概念、定价敏感度、不同群体的支付意愿。

AI聊天 (AI Chatbots):完整记录对话轨迹,追踪虚拟用户在面对AI犯错、胡说八道时的真实情绪波动和追问习惯 [1.1.5]。

网站 (Websites):智能体在这个沙盒网络里像普通网民一样搜索、比价、看评论,最终做出购买决策。

应用程序 (Applications):这甚至不再是文字层面的交锋。智能体可以直接操控 Linux、macOS 和 iOS 的桌面,通过虚拟鼠标、键盘和触控进行各种复杂的日常软件操作。系统会一滴不漏地记录下它们的文件变动、权限变化和操作轨迹。

在这个沙盒里,研究团队已经针对 25 个不同领域(涵盖商业、软件、金融、医疗等)部署了 1,010 个复杂的评估任务。

他们总共运行了18,189 次大规模模拟用户交互实验

在400次极其严苛的控制实验中,这些由底层大模型驱动的虚拟智能体,符合指定人设的一致率达到了惊人的91.5%

在对从真实人类中提取的人设进行一致性评估时,人类专家打出了 4.135 的高分(满分 5 分)。

而驱动这些虚拟人的底层大模型,其表现已经无限逼近人类评估者的黄金标准:

Claude Opus 4.8在93.8%的情况下,其评估误差与人类专家的评分偏差控制在 1 分以内!

GPT-5.5在 79.2% 的情况下,误差在 1 分以内。

这表明,如今的顶级大模型不仅掌握了逻辑和常识,甚至已经掌握了社会学的「同理心模拟器」

它们能精准地计算出一个「身处美国中产阶层、性格保守内向的50岁主妇」,在面对一个科技产品的漏洞时,会表现出怎样微妙的愤怒与失望 。

这83亿个数字幽灵,究竟是怎样被「捏」出来的?

每个「人」的背后,都有一张包含1290个画像维度的精密属性矩阵。这些维度被划分成了五大核心地带:背景信息、心理特征、专业能力、行为互动、日常生活。

数据来源包括联合国人口统计、General Social Survey、Wikipedia人物志、Amazon真实消费评论、Stack Overflow开发者调查……

如果只是随机组合,AI只会捏出逻辑崩坏的「赛博怪物」。比如,一个住在肯尼亚农村、只有小学学历、却只懂冰岛语、拥有哈佛博士学位、年入百万的存在。

为了解决这个问题,研究团队构建了一张宏大的有向无环图(DAG)。属性与属性之间存在着严密的条件依赖:

当系统决定一个虚拟人的「英语能力」时,必须先计算「主要语言」和「所在地区」这两个父节点的联合概率。

再叠加残酷的兼容性过滤器:只要父子属性出现违背常理的冲突,判定立刻归零,该组合被一键抹杀。

在这套公式的洗礼下,合成出来的虚拟人既保持了宏大的多样性,又在个体内部维持了坚不可摧的逻辑自洽。

再加上从Wikipedia、Amazon消费历史、Stack Overflow开发者调查等真实人类历史遗存中提取的数亿级「真实灵魂切片」,Persona-8B 数据库里的每一个幽灵,都像是一个在平行宇宙里真实生活过的、有血有肉的人。

你是否想过:自己对某个APP颜色的偏好,其实可以被还原成父节点概率的乘积?

当个性被1290个刻度精准测量,人类所谓的「独一无二」,在AI眼里,只是一段自洽的概率分布。

虚无的莫比乌斯环

这是技术上的神迹,但如果剥开披在外面的效率外衣,你会看到一个令人毛骨悚然真相。

大模型(比如GPT-5.5、Claude Opus 4.8)在MatrAIx里扮演「消费者」和「社会成员」,去评估和测试另一个由大模型驱动的「虚拟人」。

这就像是一个人,在用左手扮演顾客,去买自己右手做出来的面包,然后左手给右手打了一个五星好评。

在这个闭环里,真实的人类,无了。

如果虚拟用户在沙盒里给一款新药或一款社交软件打出了91.5%的高分,它在现实中就一定能取悦那些会流泪、会无理取闹、会被天气和荷尔蒙左右的肉身人类吗?

这种「自循环生态」最可怕的副作用,在于「黑天鹅与灵魂」的彻底消失

人类历史上最伟大的艺术、最颠覆性的商业模式、甚至最惊艳的科学突破,往往并不来自于1290个概率刻度计算出来的「自洽性」。

它们往往诞生于不可理喻的执念、以及偶然发生的逻辑混乱——那些被 DAG 算法过滤器视为「不兼容」而一键抹除的异常值里。

如果未来所有的数字产品、政策和内容,「AI模拟的83亿人口」可以测试和优化,那么,这个世界将会变得极其顺滑。

但也同时会变得极度空洞和无趣。

这是一个专门为了迎合「数字幽灵的偏好」而量身定制的索然世界。

论文的末尾,研究团队保持了科学家特有的克制与清醒:

虚拟用户永远无法完全替代真实人类,对于那些关乎社会命运的高风险决策和重大科学结论,真实用户的亲自参与仍然不可替代。

参考资料:

https://matraix.ai/

https://arxiv.org/abs/2608.04205

https://github.com/MatrAIx-ai/MatrAIx-Persona-8B

https://x.com/MatrAIx2026/status/2085217711781564492

评论 (5)

登录 后即可发表评论
@栋{坚持不懈}

传统研究流程被秒,产品经理要慌了。不过AI模拟的用户又不是真人,现实中哪有那么多自洽的人。

0 回复
臻美优鲜
臻美优鲜 47分钟前

83亿数字幽灵,虽说逻辑自洽可多样性有啥用,没了黑天鹅和灵魂,这世界会很无聊。

0 回复
十叁
十叁 48分钟前

AI掌握了社会学同理心,这很强大但也可怕。所有产品按模拟来做,没了偶然和执念,世界会空洞。

0 回复
你好,明天
你好,明天 49分钟前

这技术挺厉害,能模拟83亿人,但用AI测AI太不靠谱,现实里的人哪能全用概率算,这世界可不能只有顺滑没有意外。

0 回复
芬达
芬达 49分钟前

技术是神迹,可这自循环生态不行。真实人类的参与在重大决策上谁也替代不了。

0 回复
更多