You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Step-3.7我实际体验下170TPS(token per second,170大概每秒460字),对效率的提升是极其巨大的,过慢的响应不只是减速,更严重的是思路的中断,有人认为通过对算力的堆砌就能解决,但模型的架构设计存在很大影响,激活的专家数,不同的重要注意力层,都会导致相同硬件下不同模型不同速度
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
关于AI热门话题和深层次理解
MCWXT:有兴趣在我这分享一些关于AI的知识吗?
Xray4668:有什么想知道的?
MCWXT:AI这一块:比如说你是平常怎么使用的,你平常使用AI有哪些技巧,有哪些大模型值得去使用等
文章内容来自:Xray4668,题目是编者加的
关于AI的一些问题:
大语言模型(LLM)是AI的一个方向,针对LLM而非泛指AI。更具体的描述并不适用于全部的场景,固化的语言框架会限制LLM的创造力,当执行创造力任务时只保留必要的描述能够带来惊喜。
高精度的问题则需要更仔细的描述。同样的问题在不同模型中能够得到不一样的回答,集思广益远好于多次随机。我认为国内的模型的软件工程相关能力与外国SOTA最大的差距在优质的经验,国内的模型很难注意到一些不算特别常见以及细节的内容。
关于LLM的框架:MoE与Dense,MoE指混合专家模型,Dense指稠密模型。大部分大尺寸模型属于MoE,MoE由路由模型和专家模型构成,路由模型决定使用那些专家模型(通常为固定数量),这导致了极高的不确定性,错误的专家模型选择会导致知识的缺乏引发严重的输出质量下降,但选择性激活大大降低运算开销,是主流选择。Dense会同时启动向前传播和向后传播,能够在低并发时拥有更高的设备利用率,同时结果因为执行了所有层的运算更可预见。
Anthropic的Claude我认为是模型能力最佳的SOTA,但其公司政策使其实际体验远远不如OpenAI的ChatGPT。对于国内模型,我认为对于指定问题的解决Deepseek是极为优秀的,但对于编码能力依然为GLM的强项,对于Agent任务依然推荐Qwen。
如何评价一个模型?这是一个多方面的问题。
首先,我认为响应速度是一个极其重要的方面
Step-3.7我实际体验下170TPS(token per second,170大概每秒460字),对效率的提升是极其巨大的,过慢的响应不只是减速,更严重的是思路的中断,有人认为通过对算力的堆砌就能解决,但模型的架构设计存在很大影响,激活的专家数,不同的重要注意力层,都会导致相同硬件下不同模型不同速度
其次,大家都在讨论模型的能力,但我认为 幻觉率 是极其重要的。
例如deepseek,有着严重的幻觉问题(v4 flash 98%,pro 96%可能有差异,需要审核),这导致结果偏离预期,会造成极大的预期落差,同时是的时间成本大大增加。而这是国内模型尚难以解决的问题,而Claude在这里的表现最为优秀(个人体验,实际测试数据不一定最优秀)。
有关系模型benchmark(跑分)作弊
有关作弊我认为deepseek在这里是最为优秀的,属于行业典范。Qwen这类问题比较严重,但它的小尺寸模型确实优秀,能够真正的“以小博大”,但分数需要理性看待
感谢Xray4668对我的大力支持,一起加油,无限进步!
All reactions