我的网站最新发布:火辣小短裤!《昭和米国》有不少很赞的服装 场景也拉满 泉城霓裳,正装风华——2026济南时装周正装女装秀精彩上演 5岁萌娃与民警老爸吃饭,默契配合抓网逃 活力中国调研行丨“三新”引擎发力,山东激发消费新活力 出行注意!我市发布道路结冰黄色预警信号 耀皮玻璃:上半年归母净利润3396.6万元,同比下降60.67%

仙剑奇侠传3

帕多瓦大学造出“音乐小钢炮”:不依赖任何框架,树莓派也能跑AI音乐生成_我的网站

火星情报局

A |     这项由意大利帕多瓦大学计算声学研究中心(Centro di Sonologia Computazionale,CSC)信息工程系主导的研究,于2026年7月以预印本形式发布在arXiv平台,论文编号为arXiv:2607.08526。

B |     演员星星从泰国顺利回国后,预订了泰国行程的中国游客却陷入进退两难。泰国还能去吗?到底安不安全?会不会上车就被拉到“园区”?社交平台上弥漫着恐慌情绪。研究围绕一个极具现实意义的工程问题展开:当AI音乐生成模型越来越强大,我们能否把它从"只能在云端数据中心运行"的笼子里解放出来,让它跑在普通人买得起的硬件上?          你可能从来没有想过,每次让AI给你写一段背景音乐,背后其实要动用服务器机房里价值数万元的显卡,还要依赖一整套庞大的Python程序框架——光是把这套框架启动起来,就需要十几秒甚至更长时间。旅行社退订电话被打爆,感慨今年春节“完了”。有人原本没那么担忧,架不住家人一天几个电话劝阻。

C | 也有人因为不想承担高达七万元的退团损失,选择继续前行。那些已经落地泰国的人,心态也发生了微妙的变化,只要一彻底放松下来享受,就立刻提醒自己必须警惕起来,仿佛“渡劫式”旅行。研究团队认为,这个问题不是模型本身造成的,而是模型外面那层"重型包装"造成的。文 | 郭斯文 陈婧瑄编辑 | 张轻松运营 | 小二郎泰国旅行社:今年春节“完了”1月8日,演员星星被找到当天,程峰公司的电话就被打爆了。部门6个人接了一天电话,第一句话都是:“我想退团,会损失多少钱?”他在一家泰国地接社工作,负责为客人安排行程,订餐订车、预约酒店。他们于是动手拆掉这层包装,写了一个叫做 **aria** 的轻量级运行引擎,并在论文中详细记录了它的工作原理、性能表现,以及一个颇为特别的应用场景——用音乐去"模拟味道"。客户大多是来自国内携程、同城、去哪儿网等大型平台的订单,程峰通常会先替客人核算损失经费,一是机票,二是酒店,三是平台的佣金,另外平台退损费会根据个人定团日期浮动。         ---          一、为什么要把AI音乐搬到你自己的机器上          现在市面上最受欢迎的AI音乐生成服务,比如Suno和Udio,都是"云服务"——你在网页上点一下,请求飞到远方的服务器,服务器算完再把音频传回来。有些客人听完,犹豫几秒,想着再等等,有人即便全损,也始终坚定,不去了。这种模式有个天然的短板:你必须联网,必须等待,必须接受服务商的使用条款,而且一旦服务商调整策略或关闭服务,你什么都没有了。

D | 临近寒假和春节,正逢泰国旅游旺季,程峰所在部门原计划趁这段时间破300万元流水,可如今只有100万元出头。         对于音乐人、声音设计师,或者任何想在本地实时生成音效的人来说,这种"每次都得出门借厨房才能做饭"的体验并不理想。更别说物联网设备、智能音箱、嵌入式艺术装置这类场景——它们根本不可能每次都去请求远端服务器。         真正让人头疼的并不是模型本身太大太重。近几天不仅一个新单没有,后台客服收到的全是退订咨询。程峰算了算,预计20%的客人已经退单,还有10%的客人还在协商,结果未知。以当前最先进的开源音乐生成模型之一 Stable Audio 3(简称SA3)为例,它的参数量大约在1到12亿之间,远比那些动辄千亿参数的大语言模型小得多。麻烦在于它的"官方启动套件"——一整套Python环境、PyTorch深度学习框架、GPU驱动……光是冷启动(从零开始加载模型、生成第一段音乐)就需要11到22秒,还会在8GB显存的显卡上直接内存溢出,连加载都完不成。北京时间1月5日晚,演员王星女友在社交平台发长文求助,称王星2天前在赴泰国拍戏的过程中,于泰缅边境失联,怀疑“进组”是一场针对演员的骗局。由于王星曾参演多部热播影视剧,众多艺人纷纷转发,很快引起全网关注。         帕多瓦大学的研究团队决定从头开始,只用C语言和CUDA(英伟达显卡的编程接口)重写整条生成流水线,去掉一切外部依赖,做成一个可以独立运行的单一程序。这个程序就是aria。

E | 此事发酵后,越来越多被困缅甸人员家属发声,人们发现,星星的遭遇并非个例。这些失踪的“星星们”大多行踪相似——先抵达泰国曼谷的机场,在机场上车后直接被司机拉到泰缅边境,随后处于失联状态。它大约有7700行代码,除了C语言自带的数学库和线程库,不依赖任何第三方组件。

F | 社交媒体上,除了对“星星们”的声援,关于泰国不安全的消息,正如滚雪球般迅速传播开来。▲ 星星事件后,社交平台上有大量劝退泰国旅游的声音。         ---          二、aria到底是怎么工作的          要理解aria,先得了解SA3的工作流程。

G | 图 / 网络陈瑞在泰国某大型旅行社工作,负责泰北的旅行业务,主要接待华语区的游客,其中大陆游客占将近一半。当你输入一句话,比如"一段轻快的爵士钢琴",SA3会经过三个主要步骤:首先,文本编码器(T5Gemma)把这句话变成机器能理解的数字向量;然后,扩散变换器(DiT)从随机噪声出发,经过八次去噪迭代,在一个压缩的"音频潜空间"里生成音乐的抽象表示;最后,音频自编码器(SAME)把这个抽象表示解码成真实的音频波形。         aria把这三个步骤全都用原生代码重写了一遍,从文本分词器、文本编码器,到扩散变换器里的每一个注意力层、前馈网络,再到最终的音频解码器,全部自己实现。

H | 1月7号,星星事件的讨论大规模爆发,陈瑞和同事们看到消息,立即意识到今年的春节旅游市场“完了”。因为泰北距离星星失联的事发地很近,在事件的舆论中,泰北几乎成为了“不安全”的代名词。权重文件(也就是模型"学到的知识")直接从磁盘以半精度浮点格式(fp16)映射到内存,不需要任何格式转换。果然,第二天开始,旅行社的线上机酒订单开始陆续被取消。

I | 不仅是泰北,整个泰国的旅游业都受到了波及。         在运行效率上,aria采用了几个关键设计。林广衡在泰国曼谷经营一家民宿,也做机票代理的生意。1月8号,他开始接到游客的电话,要求退订机票和住宿,他身边几乎所有同行都在那天接到了退单要求。显卡端(GPU)的每步去噪循环被"捕获"成一张计算图,之后每次运行都直接"重放"这张图,省去了重复组装计算任务的开销——类似于录好一段广播后反复播放,而不是每次都重新录制。简安就是退单人中的一个。她和丈夫原本计划春节去泰国度蜜月,为了这一天,他们已经期待了两个多月。之前她上社交平台,刷到的都是泰国度假,泰国养老,悠闲舒适的图片令人向往。音频解码器采用了"窗口化解码"策略,每次只处理一小段音频,把内存占用控制在一个固定上限内,无论要生成多长的音频都不会撑爆内存。CPU端的计算经过多线程并行化和向量指令优化,充分利用现代处理器的计算能力。         此外,aria还提供了一个常驻批处理模式和HTTP服务器模式。可这段时间,她越来越频繁刷到描写泰国旅游的可怕经历,翻着评论区网友自述的真实遭遇,她越想越害怕,最终决定把机票退了,损失了3500块。小鹿是因为家人的强烈反对而选择了退票。在这种模式下,模型在内存里始终保持加载状态,每个新请求过来直接生成,不需要重新加载模型。两个月前,她就订完了机票和酒店,做了完备的攻略,在泰国要穿的衣服、鞋子、配饰,也都已经购置妥当,甚至因为担心泰国水质不好,她特地买了洗澡用的过滤头。这就好比餐厅厨师一直在厨房待命,而不是每次有客人才从家里赶来——吞吐量因此翻了一番(每个任务从0.60秒降到1.23秒)。

J |          ---          三、和官方版本比,快在哪里          研究团队在一块RTX 3070显卡(8GB显存)和一台纯CPU机器上,对aria和官方SA3 PyTorch实现做了系统对比,分三种场景分别计时。星星事件冲上热搜的那天,小鹿一晚上接到了父母三个电话,家人的态度非常强硬,并发来一长串截图,都是社交媒体上旅客失联的信息。事实上,小鹿之前有多次出国旅行的经历,在她看来,泰国并没有社交媒体上说得那么不安全。

K |          "热启动"场景是模型已经在内存里,直接生成一段10秒音频。这里两者速度相当,aria略有优势:小模型用0.13秒,中等模型用0.37秒,分别比官方的0.146秒和0.443秒快一点点。但考虑到正逢春节假期,她不想让家里担心,而且如果背负着这样的压力,“即使去了也玩不痛快”。她迅速取消了行程。这说明一旦框架开销被去掉,两者的实际计算量是差不多的。         "调用"场景模拟从命令行一次性调用,需要额外支付文本编码和权重上传到显卡的时间,aria分别需要1.23秒(小模型)和2.55秒(中等模型)。

L | 社交平台上,不少网友表示迫于家人的压力选择退票,还有人称“这个时候如果坚持去泰国旅游,会被钉在家族的耻辱柱上”。▲ 星星事件以前,泰国是大家出国旅游的热门选择。图 / 视觉中国对艾米来说,说服全家一起去泰国过年本身就不容易。         "冷启动"场景是从零开始:启动进程、加载权重、生成音频,aria分别需要1.6秒和2.9秒,而官方实现需要11.58秒和22.23秒。这个差距大约是7到7.7倍,原因就在于Python解释器启动、PyTorch框架初始化、CUDA上下文建立这些"前置工作"在aria里根本不存在。

M |          显存占用方面,aria也更节省:小模型1395 MB对比官方的2330 MB,中等模型4215 MB对比5948 MB,大约节省了40%到29%。

N | 订的是一家六口的跟团游,她和丈夫,两个孩子,还有丈夫的父母。官方实现的中等模型在加载过程中甚至短暂需要约7.1 GB显存,在8 GB显卡上会溢出,不得不使用低内存加载路径。         纯CPU模式下,aria用20线程跑10秒小模型音频需要2.5秒,中等模型需要9.8秒,大约是实时速度的4倍(生成1秒音频需要0.25秒时间)。官方的CPU社区版本在同类硬件上据报道约需11秒每次生成,而且仍然依赖PyTorch。行程很实惠,人均2000块出头,包括了往返机票和酒店。

o | 因为是第一次出国,她和丈夫都很期待,做了很多攻略,还答应帮朋友“人肉”代购很多东西。         在长音频场景(60秒)下,情况更有趣。但初一的儿子一开始就不想去。中等模型上,aria以1.28秒完成单次去噪步骤,官方的1.38秒;开启8位整数算术模式后,aria进一步降到1.12秒。艾米和丈夫一直安抚他,答应带他去实弹射击,他才开心一些。小模型上,由于自注意力计算比例更高,官方的融合注意力内核略占优势(0.38秒对0.52秒),这是aria目前唯一明确落后的场景,研究团队也在论文末尾指出这是下一步要解决的问题。         ---          四、精度可以降,但降多少才合适          现在来聊一个核心工程问题:AI模型里的权重(可以理解为模型"记忆"的内容)通常用32位或16位浮点数存储,就像用小数点后很多位来精确记录每个数值。过了两天,两位老人也不想去了,觉得不安全。如果我们允许精度降低,用更少的位数来存储,比如8位整数或4位整数,文件就会变小,内存占用就会降低,甚至计算速度也可能加快。

p | 王星的事件一出,谁也不用说服谁了,艾米和丈夫一致决定放弃泰国旅游。旅行团扣留了 5700块的机损,几乎是报团费用的一半。但问题是:精度降低了,生成出来的音乐还好不好听?          研究团队把这个问题当作一个需要实测的部署维度,而不是拍脑袋假设一个可接受的精度损失上限。他们设计了三项独立的质量评估指标。艾米有点心疼,但只能安慰自己,“一家人安安全全在家里过年就是最好的”。除了取消春节旅行计划,原本打算去泰国看演唱会的粉丝群体也遭受了冲击。

q | 叶子是陈奕迅的10年老粉,去年11月就抢到了陈奕迅曼谷演唱会门票。她原计划2月22日去泰国看演唱会,顺便玩一趟,没想到这张票最后变成了一个烫手山芋。第一项是提示词吻合度,用CLAP模型(一个专门做文本和音频相互理解的模型)衡量生成音频和输入文字描述的匹配程度。星星事件一出,各种传闻在粉丝群刷屏,传说中的“电诈团伙内部聊天记录”甚至声称要潜入演唱会现场干票大的,专门诱骗年轻漂亮的女孩和富贵多金的男人。这让歌迷们越发胆战心惊,纷纷询问官方能否退票。二手市场上开始出现大量低价转让的演唱会门票。第二项是分布质量,用弗雷歇音频距离(FAD)来衡量不同精度生成的音频在统计特征上与fp16基准版本有多大差异,FAD越小说明两者越像。第三项是味觉保真度,用一个叫wav2taste的专门模型来检测音频携带的味觉关联特征,后面会详细解释这个维度。叶子买的是1180元的票档,七八个人来问票价,甚至有黄牛来收票,直接问300块出不出。         为了给这三项指标一个"合理误差范围",研究团队做了一件聪明的事:用同样的fp16模型、同样的提示词,但换不同的随机种子重新生成一批音频,测量这三项指标在"仅换随机种子"情况下的变化幅度。这个变化幅度就成了"噪声基准线"——如果某种精度引入的变化小于这个基准线,就说明它造成的影响还不如换一次随机种子大,可以认为是无损的。

r | 眼看着出票无望,叶子不想让票砸在手里,想着大不了订当天往返的机票,飞到曼谷直接约车送至场馆,看完立刻回机场,凌晨回国内。

s | 直到1月10日下午5时,叶子正和朋友在前往餐厅的路上,突然收到了大麦的退票短信,得知陈奕迅曼谷演唱会取消,她如释重负,高兴到连去餐厅的方向都走反了。

t |          测试结果在论文中以表格和散点图呈现。▲ 陈奕迅方面宣布取消曼谷站演唱会。图 / 网络陈奕迅取消泰国演唱会的同时,赵本山原定于2月22日在曼谷举办的赵本山“欢天喜地中国年”巡演也官宣延期,并表示“将全额退款”。种种反馈让社交平台上“泰国是否安全”的结论更加一边倒。8位权重存储(q8)和8位权重加8位激活值计算(W8A8)在所有三项指标上都落在噪声基准线以内。在陈瑞的判断里,目前还没有达到退订高峰。换句话说,把模型从16位压缩到8位,质量损失小到在统计上无法与正常的随机波动区分开来。因为比起单独的机票酒店订单,跟团游类型的游客预定的消费金额比较高,退订的流程也相对繁琐,会有缓冲期。经过这个周末的发酵,退订的高潮可能会从下周开始,自由行的订单至少要减少一半,跟团游订单也会减少三四成。与此同时,GPU显存占用下降约21%,树莓派5的内存使用从1198 MB降到836 MB。进退两难除了坚决退订的人,还有一些人处于进退两难的境地。雨恩是在反反复复之后才下定决心,放弃泰国行程。更妙的是,W8A8模式(利用显卡上专门的8位整数计算单元)不仅不牺牲质量,反而是所有模式里最快的GPU模式,10秒音频只需0.10秒的热启动时间,比fp16的0.13秒还快。说来她和泰国也真是无缘,疫情前她就想去泰国,因为疫情搁置了。2024年11月末,她订过一次去泰国的行程,打算带父母一起去过春节。但就在那个月,雨恩奶奶家邻居的孩子被骗去了缅甸,没有回来。她的妈妈觉得事情有点严重,不太愿意去泰国,就取消换成了云南的西双版纳。

u |          4位精度(q4)就不一样了。后来雨恩有些不甘心,觉得“更想去看海”,又把西双版纳的订单取消了,订了三亚。后来她左思右想,觉得还是很想去泰国,也能看海,且物价便宜,更有松弛感,又订回了泰国。▲ 泰国普吉岛,当太阳落山时,游客走在海滩上。图 / 视觉中国没多久,星星的事情出来了。考虑到父母的担忧,雨恩安慰自己,以后还能有去的机会,最终取消了去泰国的机票。

v | 还好她可以全额退款,没有经济损失。涵秋一直纠结到上飞机前的12个小时。它在提示词吻合度上偏差达到基准线的5倍,在分布质量和味觉特征上也明显超出基准线。

w | 她原本不甘心机酒损失三四千元,还是决定咬咬牙继续出行。这意味着4位量化确实会带来可感知的质量损失。转变发生在网上发了一条帖子之后。但研究团队并不是因此就否定4位量化,而是指出它的价值在于"能用"而非"无损"。正是得益于4位压缩,拥有12亿参数的中等模型可以在只有8GB内存的树莓派5上运行,峰值内存约900 MB。如果没有量化,光是加载模型就会溢出。         研究团队还特别强调了一个重要设计决策:当模型权重被压缩成低精度版本后,原来的高精度版本会被立即释放掉。

x | 她发帖的本意,是想后续分享落地泰国的实际见闻,给和她有同样两难困境的人一个参考,没想到两个小时内就收获了100多个收藏,300多条评论。

y | 这意味着低精度不是在原有内存上额外叠加,而是真正替代了原有内存,是内存的"瘦身"而非"加负担"。         ---          五、在音乐里"注入"一个指令:激活引导          aria的另一个独特能力,来自它"拥有"整个计算过程的所有中间数据。

z | 有人担心她的安全,有人分享了一些出行的建议,也有人说她“落地就会被绑走”。

| 评论的反馈超出了涵秋的想象。通常,当你想改变AI模型生成内容的风格,你需要重新训练模型,或者至少微调一部分参数——这就像想让厨师做一道新菜,得把他送去重新培训。四个小时后,她写了第二条帖子,决定不去了。最终让涵秋决定放弃行程的,不是因为泰国到底安不安全,而是她突然意识到,这趟旅行已经违背了放松、快乐的初衷。在决定出行前,男友甚至说要把银行卡托付给朋友,仿佛在“交代后事”,那一刻,涵秋决定算了,因为旅途已经失去了它本身的意义。但aria提供了一种更轻便的方式:激活引导(Activation Steering)。

|          扩散变换器里有很多层,每一层都会产生一组数字(叫做激活值或残差流),这些数字携带了当前生成状态的信息。研究人员发现,某些语义属性(比如"明亮"、"悲伤"、"甜蜜")在这些数字里往往有一个固定的"方向"——就像在一个多维空间里,"甜"这个概念对应一个特定的指向。▲ 涵秋考虑再三,终于选择退票。

| 图 / 小红书博主@飞行大王除了反复斟酌后选择退票的人,也有人决定继续去泰国旅行。如果在生成过程中,沿着这个方向轻轻推一下激活值,生成的音乐就会向"更甜"的方向偏移。不去的损失实在太大了。程峰印象深刻的一位客户,报的是一家五口的私人定制团,全程住国际五星级酒店,独立用车和导游,核算退订的损失经费达到七万元。         aria的GPU计算图在捕获之前就把这个"推一下"的操作纳入其中。经过几天协商,客人还是觉得亏损太多,最终决定继续行程。广东姑娘秦可心也是因为不想承担高额退票损失,决定继续出行。她上个月就订好了1月中旬前往泰国的机票和酒店,花费7000块,且不可退款。每步去噪时,程序读取一个强度值,如果强度为零,输出和没有引导时完全一致(比特级别的完全相同);如果强度不为零,就沿着预先载入的方向向量施加一个推力。

| 泰国是她准备带妈妈出国旅行的第一站。

| 意识到妈妈在变老,可心想趁有时间多带她出国走走。想到曼谷和芭提雅的慢节奏,加上老年人签证不好办,免签的泰国非常适合妈妈,既能欣赏异国风情,旅途又不会太过劳累,现阶段她的经济能力也足够承担。星星事件刚发生那几天,秦可心对此的感受并不强烈,“好像跟我的关系不太大”,直到她打开社交平台,全是泰国旅游劝退的帖子。

| 秦可心开始出现心理恐慌,“有几晚睡不着,脑海中仿佛上演了800种恐怖场面”。

| 察觉到妈妈强烈的不安情绪,可心决定冷静下来。

| 1月8日,她发现订的机票价格还在上涨,酒店依然满房,银行的泰铢预约也是爆满,似乎一切还没有太大变化。整个操作在显卡上是图的一部分,不需要重新编译,没有额外开销。         这种设计让研究团队得以用一个有趣的应用场景来测试激活引导的效果:音乐与味觉的跨感官关联,也就是"声音调味"(Sonic Seasoning)。         ---          六、音乐能有"味道"吗          这个方向听起来有些奇特,但背后有一套严肃的心理学研究。

| 换个角度想,所有的地区都可能出现类似事件,何况泰国是个旅游业成熟度很高的国家。“对我而言,仅仅因为一个概率事件,让这笔钱直接打水漂,不太值当。

| 多位研究者(包括英国牛津大学的感官科学家查尔斯·斯彭斯)发现,人类在听到不同特征的音乐时,会产生不同的味觉联想。高音调、协和、流畅的旋律倾向于让人联想到甜味;低沉、不协和、缓慢的音乐则让人联想到苦味;明亮、快节奏的音乐与酸味相关;还有咸味和辣味对应的声音特征。”决定按原计划出发之后,她的心情瞬间平静,并给妈妈做思想工作,光去旅游还是安全的。这些关联在不同文化背景的人群中相当稳定,甚至有实验表明,特定背景音乐真的能改变品酒者对葡萄酒口感的评价。落地泰国的人这几天的社交媒体平台上,“泰国”成为了爆款关键词,小红书“泰国还能去吗”话题下有3787万笔记,知乎上相关讨论也有数百万浏览和回答。评论区充斥着各种声音,疑惑的,担忧的,愤怒的,谩骂的,不一而足。         研究团队以这五种基本味觉(甜、酸、苦、咸、辣)作为目标,尝试用激活引导让SA3生成带有特定味觉联想的音乐。         方向向量的计算方法是"均值差异法":找一批听起来像某种味道的音乐,找一批听起来不像的,计算两组音频在模型某一层激活值上的平均向量差,归一化后就得到方向向量。越往后,“理性分析”的声音越容易被淹没,或被当成“园区”人攻击。泰国游的直播间热度飙升,开播五分钟内,直播间人数能从几十直升两千,评论纷纷涌入,“保证安全吗?”“去年有遇到游客失踪吗?”“是园区的人?”种种质疑逼得主播不得不展示出经营许可证,再三承诺自己是正规团体。观众并不买账,“非得做泰国游”“忽悠几个了”的评论此起彼伏。“正在申请修改了,之后做别的地方”,刚开始主播还会无奈地允诺,后面问得急了,主播开始和评论区互怼,“你们想去就去,不想去就别去”,直播陷入一片混乱。研究团队实际上准备了两种来源的对比集:一种是靠文本提示词(比如"甜美的音乐"对比"音乐"),另一种是靠一个包含377首真实音乐片段、每首都有人工味觉评分的数据集,让人们评价每首音乐让他们想到哪种味道,然后取评分最高和最低的若干首作为对比。

|          测试发现,基于真实音频的对比集生成的方向向量更稳定、更单调,在提高引导强度时不容易"过头"。基于文本提示的方向向量则容易出现"到了一个强度后就开始走下坡路"的非单调现象,可靠性更低。有一些直播间不堪其扰后关闭了评论区,只留下背景里高糊的泰国风景视频循环播放。▲ 在一些泰国旅游产品的直播间,不少网友在评论区表达自己的担忧。于是最终实验以音频侧方向向量为主。

|          ---          七、评测陷阱与多重验证机制          这里有一个微妙的陷阱,研究团队花了很大篇幅来讨论并设法规避。他们用来优化引导方向的指标是wav2taste,一个专门预测音频味觉分数的学习模型。

| 图 / 网络1月9号晚,00后博主思佳落地曼谷机场,起飞前,她随便发了一篇小红书,告诉大家将要起飞前往曼谷,落地时,她涨了100个粉丝。思佳告诉每日人物,之前她也曾有过几条上千赞的帖子,但涨粉都没有这一条多。决定出行的时候,思佳有想过这次泰国的流量会很大,但是“真的没有想到会这么大”。一些人希望通过关注她,看一看这段时间曼谷、泰国到底是什么情况。她记录自己舆论暴风眼中的泰国之旅:去市中心的庄园吃了个早饭,又慢悠悠地打车去了一个本地人的水上市场,做串珠手链,喝咖啡,又去仙后商圈购物,买了一个包和一点衣服,最后去朱拉隆功大学百年纪念公园看了日落,晚上七点多慢悠悠地走回酒店。

| 但如果用同一个指标来评价引导是否成功,就存在循环论证的风险:引导强度越大,wav2taste分数越高,于是就报告"我们成功了"——但实际上高分可能仅仅是因为音频被扭曲成了模型不擅长处理的奇怪声音,wav2taste在这种分布外的音频上给出了错误的高分。         为了避免这个问题,研究团队引入了三个独立的"质检员",它们都没有参与过方向向量的训练。

| 第一个是CLAP文本-音频相似度,检测生成音频是否真的在语义上更接近"某某味道的音乐"这样的文字描述。仿佛没什么不同。第二个是FAD,检测生成音频的整体分布是否已经离正常音乐太远(如果音频已经退化成噪声,FAD会急剧升高)。

| “其实真的来到当地,你不会觉得很担心,我现在就坐在我那个民宿的门口,在跟你聊天,我旁边还有两个泰国当地的男孩子,他们也在那边玩手机。”思佳说。

| 第三个是音频漂移,检测加了引导之后音频与基准版本在语义嵌入空间里的距离,衡量变化幅度是否合理。但因为星星事件,家人每天都要问好多次她在干嘛。

| 为了让家人放心,思佳也会在晚上七点半左右就会回到酒店,给家人报备。         所有音频在评测前都被归一化到同一响度(-14 LUFS),确保没有任何指标因为音量变化而被蒙混过关。         研究团队在论文的图2中展示了一个典型的"退化示范":以酸味(SOUR)轴为例,把引导强度从0慢慢提高到1.0。按照以前的习惯,她可能会在夜市逛到深夜十一二点。在强度较低时(约0.1),wav2taste分数上升,CLAP相似度也上升,FAD保持在合理范围内——这说明是真实的语义偏移。但在强度超过0.1之后,wav2taste继续爬高,而CLAP相似度开始下滑变负,FAD急剧飙升到1000以上——音频已经退化成了噪声状的东西,但wav2taste反而给出了更高的"酸味分数",正是因为它在这种失真音频上失去了判断能力。这个图清楚地展示了"单靠优化目标指标"的危险性,以及为什么独立质检是必要的。一位朋友看到她的朋友圈后,也选择在1月10日落地曼谷,和她汇合了,之前他也有过是否退票的焦虑。         ---          八、实验结果:哪些味道真的可以调          研究团队把所有结论整理在论文的表三中。关键发现是:在严格的多重验证条件下,甜味、酸味、苦味这三个轴可以在小的引导强度下实现真实的语义偏移,而咸味和辣味的效果即使在"干净"区间内也很微弱,CLAP分数几乎不动,研究团队坦诚地将后两者列为负面结果。泰国到底安不安全?“其实总不能是这一两天突然间变得这样的吧,只是因为这件事爆出来了,泰国突然间就(在人们眼中)变得非常非常可怕。我记得去年12月 31 号,来泰国跨年的热度还非常高,没几天好像来泰国就马上会被绑架了。         甜味(SWEET)最稳定。我觉得泰国没有变,变的是人的看法。”但思佳也不敢劝人去泰国旅游,因为万一出了什么事,她担不起责任。对于仍然决定前去旅行的人,她的建议是:不要想着去体验比较特殊的项目,好奇心也不要太重,安安心心做一个游客,少跟陌生人说话。在小模型的第16层注入,强度0.3时,wav2taste分数偏移+0.119,CLAP相似度偏移+2.11,FAD维持在515(相比基准),属于有意义的真实控制。“其实出门旅游长点脑子和心眼就好。不带脑子的话,不止泰国危险,你在哪都是危险的。更大的中等模型在甜味上表现更好,在强度0.15时就能达到wav2taste +0.143,CLAP正值,FAD更低,"干净窗口"也更宽。

| ”▲ 思佳在星星事件后去到泰国,行程在社交平台上被很多网友关注。图 / 小红书博主@阿拉斯嘉社交平台上,不敢去泰国团建担心被整团送去“园区”的忧虑之外,还是有公司去泰国团建了。这说明模型规模越大,激活引导的可控性越好。大概因为公司行政策划了好长时间,大家凑出年底的时间也很不容易,但旅行的氛围还是有了微妙的变化。

| 1月10日,程峰从国内前往曼谷,就是为了全程接待一个公司团,走完为期6天的“曼谷+芭提雅”经典团体行程。这是一家公司为奖励2024年全国各地优秀员工,提前1个半月预定好的行程。         酸味(SOUR)在强度0.1时效果最强(wav2taste +0.419),但窗口极窄——强度一旦超过0.1,CLAP就变负,FAD爆升。团里都是二三十岁的年轻人,而且大家都是第一次出国。团队出发前两天,有人在群里提出质疑“到底能不能去”,担心下飞机就被车拉走。程峰还没来得及解释,公司行政先帮忙安抚说“跟团游结伴行动,只要不去偏僻的地方,不会出问题的”。程峰也向客人保证,旅行社有专业资质,接机会提前将大巴车牌号发到群里,车前的挡风玻璃贴上公司名称,避免上错车。苦味(BITTER)类似,在0.1时有效,0.15时就退化。

|          研究团队还测试了不同的注入操作。

| 几十号人从全国各地出发,在曼谷机场集合。和以往不同的是,程峰在机场接到客人的第一件事,就是喊客人跟家人报个平安,发个定位。除了"加法"(直接把方向向量加到激活值上),还测试了"投影放大"(放大激活值中已经存在的该方向分量)。其中有位客人因航班晚点,没能赶上接机大巴,得独自从曼谷机场打车到酒店,期间程峰时不时提醒他盯着导航有没有偏离路线。星星事件后,程峰对安全问题始终绷着一根弦,对团队的行程安排进行了细微的调整。在夜市繁华的曼谷,相较往常的九十点,程峰决定晚上七八点就结束行程,带客人回到位于市中心的酒店,并提醒客人出门一定要结伴,不要去偏僻的地方。1月11日旅程正式开启第一天,程峰带团来到知名景点大皇宫,明显发现中国面孔变少了。对于酸味,投影放大在同等味觉偏移量下比加法产生更小的FAD,质量更好;而对甜味,由于其方向分量本身太小,投影放大没有效果。这说明不同属性适合不同的操控方式,两种操作是互补的。以往中国旅游团的大巴车一辆接着一辆,数都数不过来。如今路边总共停了4辆大巴车,只有2辆载着中国游客。

| 有着同样体感的,还有已经身在泰国旅游的王梦迪。         注入位置也有影响。把引导施加在音频潜空间(SAME编码器的紧凑表示)上,对酸味效果良好,FAD甚至比残差流注入更低;但对甜味效果相反,会导致CLAP变负。

| 在文本条件向量上注入,两个轴都失败,连最小的强度都会导致退化,说明在文本嵌入空间推移会把条件信号推离训练数据分布,而不是增加味觉信息。来泰国旅游的第四天,除了偶尔见到公司年会组织的中国旅游团,周围以泰国、欧美人居多。         注入发生在去噪过程的哪个阶段也有区别。

| 在芭提雅沙滩的躺椅上,王梦迪和旁边的人都说着中文,话题因此打开,结果发现都来自同一个城市,将在同一天从芭提雅前往曼谷。双方提了一句要不要一起搭车,话音刚落,王梦迪转念一想,网上都说小心在泰华人,没法确认他的身份,还是单独行动更好。只在后半段(第4到7步)注入,效果与全程注入相当,但质量损失更小;只在前半段(第0到3步)注入,CLAP直接崩塌,因为早期去噪步骤负责建立全局音乐结构,在这里施力会破坏整体骨架。         ---          九、和微调方法比怎么样          研究团队还训练了一个对照组:针对每个味觉轴,用相同的对比数据微调一个LoRA适配器(rank=8,800步),让模型通过训练学会"给我生成甜味音乐"。于是中国人之间的默契再次出现,大家心知肚明都没有再提这件事。

| ▲ 电影《孤注一掷》截图。         结果令人意外:LoRA在任何一个轴上都没能找到一个同时让wav2taste上升和CLAP保持正值的操作点。

| 王梦迪总结本次行程为“渡劫式旅游”,快乐还没享受到,脑中就如同安装了自动警铃般,一旦过于放松警铃就会适时响起,提醒自己注意安全。

| 她们一行四人,始终以团体方式行动,除了点餐、入住、打车等交流外,基本不和陌生人说话。酸味的LoRA在wav2taste上的分数比激活引导更低,而CLAP已经变负;甜味的LoRA在统计上甚至没有显著效果。换更大的适配器(rank=32,训练3倍步数)结果也一样。自落地泰国后,王梦迪随时和父母报备行程,打车得先拍车牌号,提前告知下个行程目的地。在声势浩大的退票、劝退声中,也有人逆势而上,趁机捡个便宜。         代价比较同样明显:LoRA每个味觉轴需要约5分钟训练时间、515万参数、10.4 MB存储空间,而激活引导不需要任何训练,只需存一个4到6 KB的方向向量,在计算图里运行零额外开销,随时可以关掉(强度归零即可)。对于这种词汇描述困难、语义边界模糊的属性,用参数更新的方式反而不如用方向向量来得有效。         ---          十、激活引导在实时流中也能用          因为引导运行在显卡计算图内部,研究团队还测试了"动态调整"的场景:在一段连续生成的12块音频流中,把甜味强度按0→0.5→0的节奏慢慢调上去再调回来。在那些急迫低价转手,想捞回点本的帖子下方,同时会出现骨折收泰国旅游机票和酒店的评论。有位中国网友在泰国上学,昨日凌晨刷到普吉皇帝岛度假村酒店20-22号半价(原价5000多元)转让,去携程对比完价格,再搜了下酒店评价,立马收了,“刚好最近放假,为了这个酒店选择去那玩”。

| 泰国旅行还安全吗?程峰发现,这两年关于泰国旅游安全的讨论越来越多了。测量结果显示,每块音频的味觉分数与强度安排的斯皮尔曼相关系数为0.78(p=0.003),说明音频确实在跟着强度变化。在回调阶段,分数下降稍微滞后,这是因为后续音频会从前面已生成的内容里继承一些"惯性"。无论是2023年的枪击案,还是其他负面传言,对旅游业的影响切实存在,一般持续两到三个月,短期内客人都有害怕心理,等风波渐渐平息,想来的客人依旧照常来。

|          在树莓派5上,开了引导和没开引导的生成时间几乎完全一样(32.9秒对32.8秒),证明这个功能真的是"零额外成本"。         ---          十一、还有哪些事情没做完          研究团队在论文末尾非常坦诚地列出了当前的边界和下一步计划。目前自动评测指标可以给出有限的客观参照,但没有人类聆听测试来证实。

| 研究团队计划开展一项人类听感对比实验,用Bradley-Terry成对比较模型来量化听众对不同引导强度音频的感知偏好,以外部验证自动指标指示的"真实控制"是否真的让人感受到了味觉联想的变化。

| 可今年显然开局不利,特殊之处在于赶上了春节,而每年从12月的圣诞节到新年跨年,再到次年春节前后,都是泰国旅游的黄金期,一年中生意最好的时候。         在工程层面,小模型的长音频生成速度仍然略逊于官方的融合注意力路径,根源是全注意力的注意力权重分布太分散,现有的带状注意力近似不够准确,下一步计划加入FlashAttention类的融合注意力内核作为可选编译选项。春节旅行退单首先影响的是包机市场。此外,持久化的服务器模式和潜空间流式续生成也在规划中。         ---          说到底,这项研究做了两件在方向上都很有价值的事情。旅行社通常提前半年,甚至一年,买好足够的机位,等到春节期间卖给客人,突然产生大量退票,空座就得降价处理,如果依然处理不掉,旅行社至少承担50%。酒店和民宿也损失惨重。第一件:证明了AI音乐生成模型的"重量"有很大一部分其实来自它外面的框架包装,而不是模型本身。福建人林广衡,之前二三十年都在各国做旅行接待业务,足迹遍布非洲、东欧等地。去年年初,他看中了东南亚市场的旅游潜力,决定来到曼谷扎根。一旦把包装拆掉,用原生代码重写,同样的模型可以在普通人买得起的硬件上以可接受的速度运行,甚至可以在一台树莓派5上完整运行12亿参数的模型。第二件:证明了当你"拥有"整个运行过程的每个中间值时,控制模型生成方向这件事会变得出乎意料地轻便——一个几KB的向量,一行加法,就能把音乐往某个语义方向推,而且不需要重新训练任何东西。和淡季相比,旺季酒店、民宿的价格能翻两三倍。林广衡原本六七十元一晚的民宿,价格能提到150元左右,至于那些服务更好的连锁快捷酒店,淡季价格在130元到150元之间,旺季就能卖三四百元。

|          当然,这不是一个"一切都解决了"的故事。即便如此,旺季的房间往往提前一月就全部订满,一房难求。五星级酒店也往往早就订满了。▲ 中国农历新年,泰国当地会举行一些庆祝活动。图 / 视觉中国每年的这几天,各个酒店的经理、销售都会来旅行社拜年。

| 味觉控制只对三个轴有效,窗口很窄,人类听感验证还没有做。4位精度让12亿模型跑上了树莓派,但质量损失是真实存在的。近日由于大量退单,原本喜庆的见面活动也变了味,简直成了诉苦大会。

| 这些局限性研究团队自己说得很清楚,并没有过度美化。有一家开在曼谷市区的五星级酒店,主做中国游客的业务,前天见到陈瑞时,酒店经理说已经被取消了十几单,在聊天过程中,信息提示音一响,又有两单被取消了。对于真正想在本地部署开源音乐生成、或者想探索音乐语义控制的开发者和研究者来说,aria和这篇论文提供了一个扎实的出发点。有兴趣深入了解的读者可以通过arXiv编号2607.08526查阅完整论文,代码也已在GitHub上以aria为名开源。

| 中国游客来到泰国,在语言方面仍会有一些障碍,因此他们常常会选择华人开的酒店、民宿。相应的,在泰华人开的店,也会将中国游客作为主要的服务对象。这一次事件的震荡,对他们的影响是最大的。导游、包车等服务都产生了连锁反应。原本从除夕开始,2024年12月29 号到2025年1月 4 号这段时间,陈瑞所在的旅行社,会讲华语的导游,有牌的,有资质的,基本上已经预定完了,团队已经接不了任何额外的订单,商务面包车,也都订不到了。

| 大规模退单将会导致一系列影响。         ---          Q&A          Q1:aria运行时比官方SA3 PyTorch快多少,主要快在哪里?          A:aria的冷启动速度是官方实现的7到7.7倍,官方需要11到22秒,aria只需1.6到2.9秒。林广衡感知到,国内对东南亚“不安全”的看法,在之前就有了端倪。速度差异主要来自aria去掉了Python解释器启动、PyTorch框架初始化和CUDA上下文建立这些"前置开销",不是因为模型本身计算更快。热启动(模型已在内存中)时两者速度接近,aria略快约10%。

| 去年他刚刚定居曼谷时,有一位认识了二三十年的朋友恰好来泰国旅游,他打算请朋友一起吃个饭,逛逛夜市,聊一聊这些年的变化。         Q2:8位量化会不会影响SA3生成音乐的质量?          A:研究测试显示,8位权重(q8)和8位权重加激活值(W8A8)在提示词吻合度、音频分布质量、味觉特征三项独立指标上,偏差都没有超过换一次随机种子带来的自然波动。可以理解为无损压缩——占用内存减少约20%到40%,GPU上8位算术模式还是最快的运行模式,0.10秒生成10秒音频。但当他发出邀请的时候,他察觉到了对面的迟疑,最后,朋友以“没有办法脱离旅行团”为由拒绝了他。林广衡知道“无法脱团”其实只是托辞,但他也明白朋友的顾虑。         Q3:激活引导的"味觉控制"对所有五种味道都有效吗?          A:不是。在多重独立验证条件下,甜味、酸味、苦味三个轴可以在低强度下实现真实的语义偏移,验证通过。“跟我见面,是不是要把我骗走,把我拉走?现在很多过来东南亚玩的人,都会有这样一种戒备。咸味和辣味即使在有效区间内,独立语义检测指标(CLAP相似度)几乎不动,效果太弱,研究团队将其列为负面结果。

| ”这种戒备感,也体现在对其他游客的态度上。所有轴的控制窗口都很窄,强度稍大就会导致音频退化。林广衡的民宿类似于青年旅社,以四人间、六人间居多,以前在他这里住的游客,常常会在路上寻找有同样爱好的旅游者,结伴而行,互相分享经验。去年四五月份开始,林广衡发现,来曼谷的中国游客很少在路上“找搭子”了,公共区域的交流也在变少,陌生人之间“互相都有些防备”,都害怕被对方骗。泰国在中国游客中口碑的断崖式下跌,也令泰国官方感到紧张。

| 《曼谷邮报》报道,根据泰国旅游和体育部的数据,中国是泰国最大的旅游客源市场,去年有超过670 万人次的中国游客访问泰国。而这远未达到疫情前水平。▲ 往年春节,有不少中国人选择去泰国过春节。图 / 视觉中国2019年是泰国旅行最辉煌的一年,全年共接待外国游客3970万人次,在这之中,中国游客达1099万人次,为泰国创收5430亿泰铢,约占外国游客旅游总收入的28%。随后,疫情席卷全球,泰国旅游遭遇大寒潮。在泰北做旅游的十年间,陈瑞经历了旅游的黄金期,也面临过数次低谷。疫情是泰国旅游业整体的一个转折点。

| 疫情前,他业务的90%是大陆团。疫情期间,面对大陆订单的急速缩水,他只能不断调整,把主营业务拓展到整个华语区,包括台湾、东盟等地。2023年初疫情放开,但东南亚的旅游一直没有恢复,陈瑞觉得,“目前最多也只恢复到了疫情前的一半”。2023年3月前后,网络平台上开始流传中国人在泰国被“噶腰子”的传言,后虽然国内主流媒体进行了辟谣,泰国驻华大使馆也紧急发布澄清声明,表示“泰国高度重视中国游客的旅游质量、安全以及对泰国的美好印象”,但还是让泰国的口碑急剧下降。2023年10月,泰国曼谷市中心商场内发生枪击事件,造成3人死亡,5人受伤,其中中国公民一死一伤,很多人看到新闻后才知道,泰国是不禁枪的。枪击事件后,泰国旅游再次遇冷,至少6万名游客取消赴泰行程。同时,近年国内的热门电影《孤注一掷》《消失的她》,影片中也都涉及东南亚国家的不安全因素。很多观影者看完之后直呼可怕,再也不敢有去东南亚旅游的念头。▲ 电影《孤注一掷》截图。2024年,泰国旅游整体回升,结果2025初始,星星事件发生了。人们对泰国逐渐淡去的负面印象,又被清晰地拉回眼前。▲1月11日,泰国国家旅游局官方账号发布《关于进一步加强中国游客赴泰旅游信心的声明》泰国旅游直播间里,有主播“发疯式”吐槽:动不动就会来一下子,崩溃了,不做旅游了,准备卖牙膏了。(讲述者均为化名)参考资料:[1].《被阴影笼罩的东南亚旅游,还能翻身吗?》,每日人物[2].《泰国:2024年赴泰外国游客超过3500万人次》,中新社[3].《去泰国旅游会被“噶腰子”?多方回应》,南风窗[4].《泰国曼谷购物中心枪击事件新增一名遇难者》界面新闻文章为每日人物原创,侵权必究。

|

Current article:http://tt29ap.zuanniangwandangliaolinechu.sbs/list_8iv/bl9cfs.html

Published on:22:56:07


上一篇:教研信息 | 品悠悠古韵,享“研”途芬芳——桐乡市小学语文古诗文研讨活动 下一篇:金斯顿发布A2000/KC2000系列SSD:64 3D TLC,SMI主控

我的网站相关阅读