
一 | 在CES展览的一角,有一套国际象棋。

二 | 8 月 26 日消息,Artificial Analysis 于 8 月 24 日发布博文,宣布携手 Liquid AI,发布面向手机端的 AI 跑分基准,重点关注 AI 模型在苹果 iPhone 17 Pro 上的表现。它看起来有点适得其反,既不象高科技产品,也不象人们容易接受。其中 Artificial Analysis 负责智能水平测试系统,Liquid AI 负责推理性能测试系统,双方选用 5 项基准测试:BFCL(Berkeley 函数调用排行榜)IFBench(指令遵循测试)AA-Omniscience(知识与认知相关测试)GPQA Diamond(高难度问答测试)MATH-500(数学问题测试)。测试模型对象为 4 bit 量化后体积不超过 8GB 的模型,示例包括 Gemma 4 E2B 和 LFM2-2.6B-Exp。

三 | 来吧,这是CES。当上下文长度限制为 16K tokens 后,平均基准测试得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。比国际象棋更吸引人的东西有一万种。

四 | 当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。工作人员展示了这种产品,称之为Square-off。Nanbeige4.2-3B 是 BOSS 直聘旗下的南北阁实验室推出,仅含 30 亿非嵌入参数(总参数约 40 亿),采用 Looped Transformer 架构,通过在不增加参数量的前提下复用 Transformer 层(循环两遍),提高模型的有效计算深度和容量。

五 | 横轴表示“输出 256 个 token 所需的时间(秒)”,纵轴表示“上下文长度限制为 16K 个 token 时的平均基准测试得分”。你猜对了。“Nanbeige4.2-3B”的基准测试得分与“LFM2.5-2.6B”相当。是国际象棋。但令人惊讶的是,棋盘上的棋子可以自己移动,就像《哈利波特》中的巫师国际象棋。在上下文长度限制为 16K 个 Token 时,平均基准测试得分中得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。附上相关截图如下:。图片来源:哈利波特和哲人石,事实上,棋子是由下机械手控制,并由磁力移动。你可以和这个板上的任何人竞争。

六 | 家人、朋友甚至陌生人都可以控制对方的棋局,只要他们与移动应用程序合作。图片来源:在广场后面,一个聪明的棋盘,是一个来自印度的团队。最初的想法是为视障人士制作一个象棋游戏,因为手机和电脑屏幕对他们来说太难使用,而在真正的棋盘上,他们可以打长途,甚至参加一些比赛。后来,Square-off把这个想法付诸实践,让更多的人享受象棋的原汁原味,而不是通过互联网。2016年,他们发起了一场关于Kickstarter的群众募捐活动,最终产生了“广场效应”。你可以随时在家里开始游戏。不在身边的家人和朋友通过移动应用程序控制棋子。这个棋盘和普通的棋盘似乎没有什么不同。真正的秘密就在于内部,操纵器控制磁头,拉动磁性棋盘移动。

七 | 他们设计了一个程序来防止棋子互相碰撞。平方有很多用途。最简单的是一个人使用棋盘,对手使用移动应用控制,而不是周围的亲友在空中打架。他们还可以使用国际象棋服务,让不知名的网友也可以谈判国际象棋技能。更神奇的是与人工智能的较量,就像高洁与阿尔法的较量一样,你可以不断挑战自己的极限,训练技能,共有20种难度。

八 | Square-off不便宜,有369美元和449美元的版本。虽然你可以享受自动移动的魔力,但对大多数人来说,买一个普通的国际象棋可能更经济。从Square Off的广告中,他们对智能棋盘的定位也是粉丝们享受的礼物。
Current article:http://ee3yz.pisezuibanzoukou.cyou/ywlv2l/20260826/361.html
Published on:00:00:00