PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍是石科技自研Meta-Infer高效推理引擎通过内核补齐、算子通信重构、并行调优与缓存复用等纯软件手段,在不改动模型前提下将DeepSeek-V4.1-Flash在PCIe显卡上的推理吞吐提升近7倍,该方法论同样适用于DeepSeek-V4-Flash、GLM5.3及国产GPU。
搜索
是石科技自研Meta-Infer高效推理引擎通过内核补齐、算子通信重构、并行调优与缓存复用等纯软件手段,在不改动模型前提下将DeepSeek-V4.1-Flash在PCIe显卡上的推理吞吐提升近7倍,该方法论同样适用于DeepSeek-V4-Flash、GLM5.3及国产GPU。
AI数据创企Snorkel AI完成3.5亿美元E轮融资,估值达35亿美元,由Insight Partners和S32领投,其年化收入运行率已达3.75亿美元,较过去12个月增长18倍。
大模型江湖变天了。
看来啊,老马显然也知道,国庆前后这几天的基模圈不好混。
开发者mizorewww将开源决策模型Laya移植到Apple MLX框架,推出本地版Laya-MLX,可在Apple Silicon Mac上以低于1GB内存运行并摆脱PyTorch与云端API依赖,421M版本峰值内存943.6MiB、322M多语言版本687.6MiB。
就在刚刚,马斯克SpaceXAI正式发布,全新主力模型Grok 4.7!
2026 年 9 月,马斯克的 Neuralink 临床试验接受 27 例受试者,计划开启大规模量产。舆论再次沸腾,仿佛脑机接口的未来已到。
现在 AI 在什么事情上效率提升最明显?写论文肯定能名列前茅。
SpaceXAI正式发布Grok 4.7,定位为目前最强的编程与知识工作模型,采用比4.6更大的全新基础模型并强化长任务执行与自我核查能力,API定价与上一代持平,在多项编程基准测试中较Grok 4.6提升明显且性价比突出,但3D与网页视觉任务表现不稳,整体被视为xAI对开发者市场的一次集中加码。
APUS(麒麟合盛)旗下AI实验室公开全球最早一批Jev独立开源复现成果fast-browser-use,基于Qwen3.5等开源模型在RTX PRO 6000上将单次决策压缩至79毫秒,并以9B小模型对标Jev性能。