跳到主要内容

22 篇博文 含有标签「学习」

查看所有标签

💩与🍋

· 阅读需 4 分钟

1970 年,经济学家乔治·阿克尔罗夫(George Akerlof)在三流学术杂志1的文章。

🍋与🍑

在美国的二手车市场里,「桃子🍑」和「柠檬🍋」分别指优质二手车和次品二手车。(因为一个比较甜,一个比较酸?)

下文还是沿用「柠檬」或🍋来指代次品。

这篇文章被《经济学季刊》收录之前,曾被三个学术期刊拒稿,理由都是「结论太显然」。到底显然不显然呢?你来判断看看:

「柠檬」市场理论

文章大意

作者的结论是,因为在二手车交易过程中,卖家知道车的品质,而买家并不知道,双方的信息是不对称的。这就会导致市场上交易的二手车品质全面崩塌。

  1. 买家因为不确定买入的二手车的品质,所以买入价就必须要打个折扣来计入买到🍋风险;
  2. 这个打了折的价格,对于卖🍑的车主来说是亏的,对于卖🍋的车主来说还是赚的;
  3. 于是,卖🍑的车主开始离场,市场上卖🍋的车主渐渐变多;
  4. 因为🍋的几率变高了,买家愿意出的价格就越来越低,导致卖🍑的车主加速离场。
  5. 最后市场上只会剩下🍋。

你觉得显然吗?我觉得就是满显然的……可是我怎么就没想到过呢?

你可能已经知道了:因为这篇文章,阿克尔罗夫获得了 2001 年诺贝尔经济学奖。(那三家拒稿的杂志社情以何堪……)

打破「柠檬」宿命

品牌效应

卖家通过品牌来给品质的一致性背书。品牌的本质就是将原本的单次博弈转换成重复博弈

二手车市场里,像 CarMax 之类具有专业鉴定能力的二手车车行开始兴起。买卖双方都觉得自己能够以更加透明公允的价格交易,「柠檬」宿命也就打破了。

追溯权利

该论文发表五年后,美国通过了《「柠檬」法》(Lemon Law),大幅提高了消费者在买到出厂次品后的维权能力。

美国整体的退货政策可能是全世界第一,几乎没有不可以退货的商家,尤其是像 Costco 这类的高端商家,完全不用担心买到次品的情况。

去中心化

如果把「市场」本身也想成一个个体的话,让多个准入和交易机制不同的「市场」竞争起来,让那些机制不健全,信息不透明的市场被「柠檬」市场理论预言的机理淘汰掉,让优质的玩家能够有不同的市场可以选择,这也是对抗🍋趋势的一个重要手段。

信息的「柠檬」市场

「柠檬」市场理论的核心是「关于商品品质的信息不对称」。那么,今天的信息市场是不是这样的情况呢?

今天的信息市场是上所使用的货币是「注意力」2。信息贩卖商把这些代币收集起来,可以换成「钱」或者「政治资本」。

当你分不清信息的真假,甚至是不是出于 AI 的时候,你的注意力就会打折。全心全意发表高质量信息的人(专业新闻人、艺术家等)就会被劣质消息的创作者取代。这是妥妥的「柠檬」市场。

所以今天,言论越极端越惊悚,流量就越大。掏心掏肺一个字一个字打出来的经验分享帖,因为信息过于详细,上来就被人点踩说是 AI 生成的(别问我怎么知道的,我从来不上 Reddit 的🥴)。

今天的社交媒体平台已经过了那个💩化(enshittification)的崩盘阈值。加上 AI 的崛起,从社交媒体获得信息已变成了注意力入不敷出的亏本买卖。

最后感慨一下,阿克尔罗夫这个诺贝尔奖真是实至名归。

Footnotes

  1. 2026-05-03 订正:Quarterly Journal of Economics 根本不是三流杂志……还是很顶级的经济学期刊。不过他的文章是被别的杂志拒搞了三次之后,第四次才在这个杂志上发表成功的。

  2. 「注意力就是信息市场的代币」这件事情被 Brave 看得很透彻——它们的区块链代币名字就叫 Brave Attention Token

十块钱六瓶

· 阅读需 1 分钟

高二那一年,学校在一个营地组织了一次过夜的秋游。我们班级争取到了给全校各班售卖零食的机会。

我们大概是以一块钱一瓶的价格批发了可乐,然后定了以下卖价:

  • 两块钱一瓶
  • 三块钱两瓶
  • 五块钱三瓶

许多同寝室的学生就来买「十块钱六瓶」,因为一捆正好就是六瓶,这样就不用拆掉包装了。

第二天,活动圆满结束。班里的同学们坐在一起清点账目的时候,突然有一个人说:

六瓶不应该只要九块钱吗?1

Footnotes

  1. 如果你没想明白的话:因为「三块钱两瓶」啊。

扑克谜题与人生机遇

· 阅读需 2 分钟

这是一道数理方面的面试题:

一副洗好的扑克牌(去掉 Jokers),一张一张被翻开看见。你可以在任何时候叫「停!」。这样,下一张翻开的牌就决定你的胜负:

  • 如果下一张是红,则获胜;
  • 如果下一张是黑,则失败。

如果你一直不喊「停!」那么由最后一张牌的颜色自动决定你的胜负。

请问,你用什么样的策略,可以最大化你的胜率?

可以想象,如果你看见了很多黑牌被翻开,那么剩下是红牌的概率就会越来越大;可是,翻开的是不是黑牌,也不由我们控制啊。万一翻开的是红牌更多,我们到底是要等下去,还是果断止损?

下面是答案分析

如果想要好好思考这个面试题的话,暂时不要读下去。

如果你能自己把答案想出来,会很有成就感的哦!

这道看似概率计算超级复杂的题目,其实是有诀窍的,根本不用动笔计算。

在你喊「停!」之后,按照规则,你要翻开的是牌堆的下一张。但是,剩下的牌既然都没翻开,挑哪张翻开其实从几率上都是没有差别的,对不对

所以,你可以选择不要翻开下一张牌,而是翻牌堆的最后一张牌——反正这也不会改变你的胜率。

可是神奇的事情出现了:既然是最后一张牌,那在洗完牌的时候,它是红是黑就已经是确定的事情了,完全不会受到任何策略的影响。这最后一张是红牌的几率是 50%。也就是说:

无论你用什么样的策略,这个游戏的胜率始终是 50%。

人生的机遇也可能是这样

你看着一些人成功,觉得自己的机会被抢走了了;看着一些人失败,觉得自己的机会起来了……

这一切可能都是错觉:无论你如何自作聪明地策划,你从一开始算起的胜率是不变的。

可是,为什么要被动地等到最后一张牌来决定你胜负呢?

既然总胜率一直都是 50%,早点胜利它不香吗?

游泳小知识🏊‍♂️

· 阅读需 2 分钟
  • 自由泳不是一种泳姿,而真的是字面上的「随便游」;至于绝大多数人在自由泳比赛中选择的泳姿,叫爬泳
  • 蝶泳和蛙泳要求每次转身都要用双手同时触壁,所以是不可以用前滚翻转身的;双手没有同时触壁即算犯规。
  • 最容易犯规的泳姿是蛙泳,无论是中期手脚的协调,还是转身后允许的海豚式踢腿次数、手划的动作等等都有细致的要求。
  • 游泳与赛跑一样,抢跳一次即出局。
  • 大型游泳比赛的分组赛,英语叫 heat(Heat X 就是第 X 组)。有时候某一个分组会被宣布为 hot heat,然后比赛的时候又是放音乐又是敲锣打鼓的,我原本还以为是什么「黑马对决」之类的精彩分组——实际上,hot heat 只是被随机抽中的「有奖分组」,小组第一名能获得额外的小礼物(比如一根棒棒糖🍭)。

我是弱鸡,只会蛙泳(属于犯规的那种,狗爬泳好像也可以)。这些都是坐在看台上学习到的。

大型标准化考试的算分理论

· 阅读需 7 分钟

我去年 12 月参加了日语 JLPT N1 的考试,三天前结果发榜了。我的成绩是:

文字·词汇·语法60/60
阅读理解60/60
听力理解48/60
总分168/180

虽然前两个部分我坚信自己错了不少题(至少 6~8 题吧),但是因为 JLPT 的评分标准,我居然都得了满分 🥳 那么今天就来介绍一下包括 JLPT、TOEFL、GRE 在内的绝大多数大型标准化考试都在使用的,能把错题都算成正确的评分机制吧。

分数就是能力吗

一般考试的评分机制大概都长成这样:

  • 第一大题,每小问 2 分;
  • 第二大题,每小问 3 分;
  • 第三大题,每小问 5 分;
  • 第四大题,总分 10 分;

然后把正确题目的得分加起来,就是你的总分。不过,这样只能算出你在这次考试中的分数,那么你的能力值到底是多少呢?

你也许会觉得这不是废话吗?分数是多少,能力就是多高啊!

如果这样想的话,背后的推导逻辑就是「考试分数➡️个人能力」。但事实上的因果关系应该是「个人能力➡️考试分数」吧!这就是项目反应理论(Item Response Theory)的逻辑:

考试的答题反应(Response)是个人能力值(一个「在你身上的虚拟数值」)产生的一个结果。一个人的能力值越高,就越不可能在简单的题目上犯错,同时也越可能正确解答困难的问题。

根据你每道题的回答,我们可以试图算凑出一个能力值,最能够解释整张答卷的对错分布。这就是许多大型标准化考试使用的评分机制。

贝叶斯推理

顺便提一提,这种遵循因果关系,从结果来反推出原因的统计方法,叫做贝叶斯推理(Bayesian inference)贝叶斯(Thomas Bayes)毫无悬念是统计学中最重要的人名。

为什么要强调「大型」呢?因为每一道题的难度在考试前其实很难客观估算,经常会有「这一年题出得太简单,那一年题目爆难」这样的现象。最好的估计方法,就是从全部的答卷中统计出每道题实际的「难度曲线」(学术名称「项目特征曲线」,即能力值对应的答对概率)。如果考试不够「大型」,考生人数太少的话,这种测量题目难度的方式就可能不够准确。

一个具体的例子

假设,一个英语能力测试有四道选择题:

  • 英文字母表中第一个字母是 (A/B/C/D)
  • large 意思 (big/small/tall/short)
  • If I (am/be/was/were) you, I would choose neither.
  • elaborate 的反义词是 (equivocate/exacerbate/exonerate/enervate)

假设整个测试的满分是 10 分,四题全部答错得 0/10,四题全部答对得 10/10。这两个结果没有悬念。

但如果没有全部答对呢?这时候就要区分两种情况:

  • 一个能力值很高的人,犯了低级错误;
  • 一个能力值很低的人,沾了狗屎运;

假设有一个人回答对了第一题,但是 2~4 全错。那么最有可能的解释是「此人能力值很低,只知道字母表」,因此得分可能是 1/10。

那如果他只回答对了最后一题,1~3 全错呢?用数理统计的方式很快可以得出「最有可能的解释是此人狗屎运蒙对最后一题,实际上却连字母表都不识」,他的得分几乎肯定是 0/10。

你看,第二个人答对了一道最难的题,得分却比答对最简单的题目的人还要低!这很符合逻辑,但是用传统的算分方法是不可能得出这种结果的。

这种算分方式甚至还可能逆转评分标准。比如上面的第三题,现在一半以上的文盲美国人1都不知道虚拟语态(subjunctive mood)的语法,所以这题的回答很可能出现「错误回答反超正确答案」的情况。根据不同语言考试的标准,这样的现象甚至可能会推翻题目本身,导致答错不扣分。

应试技巧

IRT 算分机制非常复杂,一般先从全体答卷中统计出每道题的响应曲线,再通过响应曲线计算出每个考生的能力值,然后还要回过头去验证计算出的能力值分布是否与历年的分布一致,再作调整。反反复复好几轮计算调整后,才能得出最为准确的结果。

所以,答对某题对于分数的影响变得非常不好预测。也许一题之差,就能让你从「好像很强,只是运气差了点」变成「好像很弱,只是运气好了点」,分数也随之天差地别。不过 IRT 的目的和大多数时候的效果帮助了「能力强但稍微粗心」的学生获得更高的成绩。

如果你能够安排自己的注意力,或者改变解题顺序,做到在你认为简单的题目上千万不要失误,这是应对 IRT 评分标准最最重要的策略

一旦简单题目上连续出错,模型的预测就会倾向于认为难题的正确都是偶然——这就需要难题连续答对才能排除这种猜疑。相反,对于自己很没有把握的难题,千万不要浪费时间,乱猜一个答案可能都不会失分

自我感想

看见自己文法和阅读双满分的时候,简直不敢相信!好高兴啊!都快四十岁的大叔,找回了初中生期末考试考满分的感觉,哈哈。

听力才 48/60,比预期要低了一些,心里有点点不服气 🫤 不过 IRT 帮我拿了两个满分,只拉低了其中一个,我已经很满足啦~

因为得到了 142+ 的优秀成绩(CEFR 语言能力评级达到了 JLPT 最高能认证的 C1),我的 JLPT 之路就算一步登天式的圆满完结!自己给自己半年来的辛苦学习撒个花~

Footnotes

  1. 这不是我随口瞎说的——有权威统计显示,54% 的美国成年人口没有达到小学六年级的读写水平要求。https://www.thenationalliteracyinstitute.com/2024-2025-literacy-statistics

最容易读错的英文单词

· 阅读需 1 分钟

绝对的王者,当之无愧的第一名,就是这个单词了:

indict

「提起公诉」的意思

这是一个在美国新闻里特别常见的词语,意思是「提起公诉」。但可能是因为是法律词汇,我在来美国之前完全没有接触过。

关于这个词的发音,我在美国问了周围一圈的中国朋友,基本上全军覆没!

它的读音是「隐代特1」—— i 是「爱」音,c 是不发音的!什么鬼逻辑!

第二名 Infrared - 外线,所以是 Infra-Red 呀,根本就不是一个名叫 infrare 的动词的过去式(真的只有我上了一辈子的当吗)。

第三名 Worcestershire sauce(what-@$%^#! sauce),喼汁2

Footnotes

  1. 千万不要像我这样用中文标注英文发音。

  2. 怎么样,翻成中文了还是不会读吧。不过它还有一个中文名字叫辣酱油,我小时候的最爱。

面试的秘诀

· 阅读需 5 分钟

我没有参加过高考,取而代之的是大学自主举办的入学考试,分为笔试与面试两个部分。今天靠着不完全记忆,我来复盘一下当时面试的过程,以及我在不经意间发现的一个面试秘诀。


面试的教室里坐着一排五名考官,我则坐在对面的座位上。最正中的貌似是主考官,数学系的教授。大致的对话如下:

主考官:你对数学的哪个领域比较感兴趣?

我:我对数形结合的领域比较感兴趣。

主考官:那请问,ax2+bxy+cy2+dx+ey+f=0ax^2+bxy+cy^2+dx+ey+f = 0 在什么条件下是双曲线?

我:(黑人问号?……这高中教材里根本没有这样的形式啊)需要整理一下变换成标准型就可以判断了。

主考官:啊,你连 a^%@b%$c-@d+#e%$f 都不知道吗?

我:(尴尬,委屈,无语)

「对什么感兴趣?」

这个问题之后,基本就会跟着对你感兴趣的领域的追问。因为面试官第一要务,是判断应试者自我描述的夸大程度,这将成为整个面试评分的标尺。

主考官:那好,0.999999(念了六个 9)和 1 哪个大?

我:(黑人问号?)……那应该是 1 比较大。

主考官:啊?1 比较大?

我:(问号,问号,问号)

消除误解

如果遇见特别诡异(感觉与职务需求或个人品格无关),或者异常简单(像我上面的例子),应当确认意思。比如我当时就应该问:「0.999999 比 1 小,这个问题似乎太显然了。是不是我误解了您的题目?」

主考官:抛物线 y=x2y = x^2 两端的夹角,会越来越大还是越来越小。

我:越来越小。因为通过求导可知斜率为 2x,两端趋于负无穷和正无穷,都是 90 度。

主考官:嗯。(怎么眼前这个弱智突然还知道求导)

抓住翻盘的机会

如果面试一开始搞砸了也没关系,就当没发生过就好。给考官留下由低到高的印象,其实也挺好的。

考官二:你还有什么兴趣爱好?

我:计算机是我的爱好和特长,尤其喜欢编程。

考官二:那你知道摩尔定律吗?

我:半导体产品的性能平均每 18 个月翻一番,同时价格降低一半。

拓宽自己的常识

「万精油」式的知识储备非常重要。平时可以多读一些像《十万个为什么》这样涵盖多个领域的浅显科普读物,既有意思又实用。它不仅能帮助我们在面试等「广而浅」的场合从容应对,更重要的是,当我们在自己的专业领域深入钻研时,这类广泛的知识积累也常常能带来创新的突破。

考官三:你今后的志愿是什么?

我:想在软件行业创业(……巴拉巴拉……)比如国产软件金山公司就是一个很好的模范。

考官三:那请问金山公司的老总是谁?

我:(尴尬!……但是面试结束后想起来了 WPS 的万能密码1

下方重点

我:(对主考官)我现在明白了您刚才想问的是「0.9 循环与 1 哪个大?」我误解您的意思了。这两个数是一样大的,因为 0.9 循环会收敛到 1。说到收敛,我突然想到数学里有一些概念正是因为无法收敛,而引发逻辑问题,譬如「罗素悖论」就是「集合嵌套」这个概念不能收敛。(其实这个关联有点牵强……)

主考官:(眼睛突然放光)你还知道「罗素悖论」?那你知道罗素悖论最后是如何被解决的吗?

我:(正好在书店乱买过高等数学书读到过!)应该是被 ZFC 集合论解决的。

主考官:(形势完全逆转)没想到你知道的还挺深入的。你还读过什么书,有什么兴趣?

我:(完全转为主场)还有(巴拉巴拉一堆书名和数学理论,五个考官不住点头)

无意中发现的秘笈

如果你明确知道面试官想要考察你哪方面的能力,你又觉得自己之前没有发挥出应有的水平,或者面试的问题没能让你充分展示自己的知识,你总能在面试的最后做这两件事:

  • 赞赏面试官出的面试题目(希望是真心的)
  • 用「面试题目让我想到了『某个我特别擅长的相关领域』」强行给自己一个额外的展示机会

总结

面试带有很强的随机性。也许一个趣味相投,就让你轻松过关斩将;也许就一个简单问题的误解,五分钟之后就变成了垃圾时间。但是,面试有一个非随机化的诀窍,就是一定要找到机会把被动回答变成主动的展示。只有应试者主动展示自己的才能,面试才有更大的确定性,这也是大多数面试官所偏好的互动方式。

Footnotes

  1. 在 DOS 年代,金山 WPS 是简体中文的主要排版软件。WPS 的文档可以设置密码,如果忘了,可以用万能密码 Ctrl + QIUBOJUN 解锁——这个 QIUBOJUN 就是金山公司创始人求伯君的拼音。

优秀的营销

· 阅读需 4 分钟
本周末就去考 JLPT N1 啦

几个月前心血来潮想要系统地学好日语,给自己报了年末的日语 N1 考试。一转眼就快到考试的日子~

虽然拿到 N1 成绩对我没有任何实际的意义,但强迫自己准备一个考试的感觉还真的挺怀旧的。这几天回到家陪好娃了,剩下的时间都在刷题、背单词、看视频。

不过除了日语以外,让我领悟最深的是日语老师的营销功夫。

案例一

给我印象最深的是「日本語の森」——来看看它是怎么一步步赚学生的钱的:

  • 在美国亚马逊上搜 JLPT N1,前排就有「日本語の森」编写的教材「この一冊で合格する」,评价也非常好。
  • 买回来一看,单词部份只有词和发音而已,没有词义。书上说「本书提供十几种语言的词义,可以下载我们的 APP 配套使用」。
  • 于是我下载了 APP,发现单词部份完全是免费提供的,其余部分的视频讲解需要再在 APP 里订阅。
  • 本来打算就看看书好了,不过 APP 里给了几个样片。点开一看,语法讲解前面有一个日语老师自己拍的搞笑迷你小品来展示语法的使用方法,好有意思。
  • 抱着想看看其他小品的心态,订阅了两个月的会员。

我觉得价格良心,内容精良,讲解非常简练没有废话。老师是长得很甜的日本美眉,发音自然也很标准啦。我觉得给 N1 词汇语法打个基础,花了一本书加两个月的订阅,很值得~(实际上,书里的内容除了两套模拟试卷外,剩下的内容全部都包括在 APP 里了,有点点白买的感觉)。

案例二

下一位是 YouTube 上的一个日语老师「抓尼先生」。看他的教学视频有一种让我们这些接受中国教育的人感到非常熟悉的「应试教育」的爽感——

  • 「题目千万不要按顺序做!」
  • 「看见『のだ』就是文章主旨!」
  • 「和文章里用词高度重合的选项肯定是陷阱!」

这才是我想找的教学影片嘛 👻 这位「抓尼先生」自己的日语当然很不错(除了他的发音是完全中了我这篇文章里提到的头号问题),不过让我倾佩的是他总结的应试技巧非常实用——和他的营销技巧:

  • 他在 YouTube 上放了许多高质量,很有意思的零散日语小知识以及应试技巧。
  • 每个视频都必要给他的「黄金检定课程 2.0」打广告,而且说的都是「送你 70 分钟的免费课程」。
  • 点进他自己的课程网站,要求你「看完三分钟的课程预览,才允许你报名」(实际好像并不是)。
  • 预览里解释到,一个人只能看一次,不提供回放和快进,但是可以暂停做笔记。要腾出不被打扰的 90 分钟时间仔细学习。如果全部看完,送你一份最新单词表。
  • 免费的嘛,这个要求很合理。于是我点进去看了,的确有很多的干货,证明了这个老师是非常有想法,善于总结的老师。
  • 70 分钟的课程,举了不少例子,但更多的是「时间有限,我举三个例子;剩下的在我的完全课程里有详解」。
  • 课程的最后二十分钟,是完全在推销他的课程——里面有什么,为什么远比别的课程有价值,为什么现在就要订阅,讲得很有理呢。到这时候我才明白,原来重点不是不能回放,而是不能快进;为了拿到看完才送的单词表,还是把整个广告部分全部看完。
  • 滚下去看了一下价格,997 美元……好贵,但是我的感觉是「有预算的话绝对应该试试看」(我只剩下没几天了,当然就没买)。

这两个老师的营销手法,都是一环套一环,每一环都展现了自己的实力和巧思,每一环都给消费者部分但实质的益处,每一环都会有力地指向下一环。在竞争白热,内容趋同的标准化测试准备课程里,要能脱颖而出,营销和业务这两项都是必不可少的。我觉得这两个都算是很不错的营销案例,在营销能力的背后,当然离不开他们自身过硬的实力啦。

Jealous ≠ Envious

· 阅读需 3 分钟

在现代最常用的语境下,jealous / jealousy 和 envious / envy 几乎是同义词,中文里把前者翻译成贬义的「嫉妒」,后者翻译成褒义的「羡慕」。前者在英语里一定是贬义词,后者可贬可褒,基本上这就是大多数英语老师教我们的意思。❌❗️

Jealous 和 envious 的深层含义完全不同,甚至可以说是「反」义词。

小测验

在下面句子的空白处选择 jealous 或 envious 中更合适的词语填入:

  1. I was _____ of her ability to speak multiple languages.
  2. He felt fervently _____ of their luxurious vacation.
  3. She gazed at the beautiful garden with _____ eyes.
  4. I am very _____ of people who can easily make friends.
参考答案

全部都是 envious😜

下面这些例句可能让你体会 jealous 的语义:

  1. He was jealous of his friend's attention.
  2. The dog seemed jealous when I petted the cat.
  3. A jealous rage consumed him after the betrayal.
  4. A jealous partner often struggles with trust issues.

不知道你有没有感觉到:Jealous 的原意是「吃醋」。

总结

Jealous 通常指的是害怕失去自己已经拥有的东西。 重点在于保护,以及对失去的恐惧

Envious 指的是渴望别人拥有的东西,自己却没有。 重点在于想要,是一种对别人拥有的好东西的渴望。

中文的「嫉妒」则是第三种意思:对别人的成功或优越地位所产生强烈的不快。「嫉妒」包含了「羡慕」的成分,却不是逻辑上的必要条件。一个人可能对别人的成功没有很大的羡慕之情(比如两人的专业领域毫不相关),这种「嫉妒」纯粹就是「别人爽了,我就不爽」。可能英语世界的人无法感受我们东方人的这种毫无逻辑的特有情感吧🤣

现代英语里,jealous 这个词的确已经开始包含 strongly envious 的意思了。我想可能是因为 jealousy 的感觉远远要比 envy 更强烈,两者以情感程度为共通点渐渐靠拢了。但可惜这种与「羡慕」完全不同的情感,在中文里却只有一个非常口语化的词语「吃醋」来淡淡地描述。也许,东方人的「吃醋」就是没有西方人的酸劲儿强~

看来东西方文化有各自的弱点,从词汇中便能得以一窥。

一个经典例子

这让我想到了《圣经》里的摩西十诫,其中第一条(《出埃及记》第 34 章 14 节)就说到:

“Do not worship any other god, for the Lord, whose name is Jealous, is a jealous God.”

这节圣经经文要翻译成中文非常困难,而且文字完全不能达意:

不可敬拜别神、因为耶和华是忌邪的 神、名为忌邪者。

很多中国人读到这里看不懂「忌邪」什么意思,跑去翻了英文版「哦,原来是忌妒的意思啊!……可是神为什么要忌妒别的假神呢?没自信吗?……😵‍💫」

其实原意是:以色列的神是「会吃醋的」神!以色列人如果敬拜别的偶像,神就会有强烈不爽的情感!

显然,这里的 jealous 绝对不能用 envious 代替,否则意思彻底错乱!但是《圣经》里用「吃醋」,格调也明显不对啊……翻译无解!

95%

· 阅读需 5 分钟

写博客就像是开垦了自家院子,面对一块翻过土的空地,不好好把它种满了感觉很浪费。想到我在中学期间经常写一些小游戏,如果能重写一遍摆到这个网站上似乎是个不错的点子。

作为有娃上班族,我自然是没有工夫花大量时间写网页小游戏的。但是用来练习 AI「氛围编程」(vibe coding)倒是正好啊!一来网页前端开发一直是 AI 编程最强项,真人反而很难搞定 CSS 之类的细节;二来我的 JavaScript/ReactJS 非常烂,顶多只到了看得懂代码的水平,要动手写的话还要从查一堆资料开始。

之前我用过 RooCode 之类的智能体助手,不过这次想上下班的时候在手机上搞,于是选择用直接聊天来测试。不得不说,Claude 真的是很厉害,一个游戏基本上第一次尝试就能直接做对 95%,而且界面也挺漂亮。那个工作量我觉得对于我至少是要花三四个小时(假设我 ReactJS 熟练的话),AI 两分钟就搞定了!

但是,剩下那 5% 才是重点。我把这 5% 分成五个 1% 好了:

  1. 微调外观(1%)——「那个蓝能再深点吗?啊呀太深了!再浅点?不要跟背景太接近。不行,那样太突兀了!还是回到之前那个蓝色,能再深点吗?……」
  2. 清扫垃圾(1%)——「诶?这个代码什么作用?到这里整个页面都保证加载完毕了,为什么还等这个组件?这游戏总分不是奇数吗,怎么还要考虑平手?能不能把没用的代码都去掉?这下看着干净多了~阿哟妈呀,程序执行不了了!全部恢复到最初的状态……」
  3. 验证逻辑(1%)——「明明让你找到全局最优的点然后移动过去,你为什么代码写的是邻近最优的点?觉得我好骗是吧?……好吧反正玩家也看不出区别,能运行就算了。」
  4. 呵斥浪费(1%)——「能把节点数从 49 改到 63 吗?……停停停!!就改一个数,你丫为什么开始重新生成一千多行代码?骗我 token 费是吧?告诉我在哪一行改就好!……为什么根据你说的这个行号我找不到这个变量?算了累死了,一千多行代码重新生成一遍吧……」
  5. 怀疑人生(1%)——「为什么跟你沟通那么费劲?说了好多遍了,路径选取要随机化!啊,不是那样随机,那不就变瞎走了吗!要从等效的路径里随机选取。啊,不是那个等效!……」

最后还是折腾了半天,终于把两个游戏写到 99%,之后再来补足 1% 的纰漏吧。

AI 使用者的两难窘境

有人说,AI 主要可以替代初级员工的工作。我个人不是很赞同,因为单从执行基本任务的能力来说,AI 远超初级员工。但是 AI 将任务臻于完美的能力极差,主要是因为目前的 AI 与人的沟通有很大的障碍。随着任务与最终完美目标逐渐逼近,描述还不够完美的部分细节所需的沟通成本会急剧增加。

这种沟通障碍和目前 AI 的训练的方式有很大关系。比如,让一个初级员工完成某个项目,如果对方能力不足,没有信心把事情做对,那么就算他一开始不告诉你,你也可以从他完成任务过程中的流畅度和回馈中察觉出来。但是你让 AI 做什么事,目前的 AI 都会一本正经、自信满满地吐出一大堆结果来,几乎从来不会坦白它没有自信。

另外一点是,AI 的知识技能结构与正常的人类差别特别大。比如说,现实中的初级人类程序员,往往已经具备了很好的编程逻辑思维能力,但是由于严重缺乏某些编程语言的特定知识,写出来的程序「味道怪怪的」。要等到在实战中千锤百炼,被各种问题挑战以至学习到各种奇技淫巧,于是升级成为了高级程序员。而 AI 对于奇技淫巧的掌握一开始就远远超过普通的程序员,但是在编程逻辑上其实要落后于人类。于是,看人类写的代码,一眼就能评判此人的水平。但是 AI 的代码表面看起来都是标准美观,似乎出自经验特别丰富的程序员之手。但是仔细审读往往会发现特别基本的逻辑错误。

这两者归纳起来,都是一个问题,那就是判断 AI 完成品的质量要比人类完成品困难许多!这就导致人类无法根据自己的快速判断,来决定自己还要花多少精力来审查和补充。于是,要么轻信 AI 闹出诸如司法假案例1这样严重的事故;要么过度怀疑 AI 的成品,费时费力地验证所有细节,到头来还不如亲自操刀的两难窘境。

Footnotes

  1. https://www.reuters.com/legal/government/trouble-with-ai-hallucinations-spreads-big-law-firms-2025-05-23/