2 篇文章带有标签 “kimi”

Kimi K3 技术论文解读

一、研究背景

大型语言模型(LLM)的发展一直沿着两条轴线推进:

  • 第一轴:预训练规模扩展——在部署前投入更多计算,训练更大的模型、使用更多的数据。这是传统意义上的"Scaling Law"。
  • 第二轴:测试时计算扩展——通过强化学习和推理时增加思考预算,让模型在回答问题时"想得更久"。

近年来,OpenAI的o系列、Anthropic的扩展思维模型、DeepSeek-R1和Kimi K1.5等工作,让"测试时扩展"成为前沿研究的核心焦点。然而,开源社区在第二条轴上进展迅速,但在第一条轴上却明显滞后——大多数开源模型仍停留在1T参数规模左右。随着越来越复杂的推理和智能体方法被应用于规模相近的预训练模型上,开源进展面临趋同风险,而与最强大专有系统(Claude、GPT系列)的差距可能持续扩大。

与此同时,真实世界的智能体任务需要处理超长上下文(如软件工程仓库、数万页文档、多天跨度的对话),要求模型同时具备大参数规模、长上下文窗口和原生多模态理解能力。Kimi K3正是在这一背景下诞生的:同时推进两条扩展轴,将预训练基础扩展到前所未有的3T类参数规模,同时在1M上下文长度上扩展强化学习、推理努力和长周期交互

二、要解决什么问题

Kimi K3要解决的核心问题可以概括为以下

Kimi(月之暗面)简历的探索

这里使用了 Kimi 月之暗面 对简历这个场景进行了探索,Kimi 支持 128k 的长上下文,超过20万个汉字。

通过简历评估一下这位算法工程师的能力。

上传简历

根据李秀宁的简历,我们可以对她的技能和经验进行以下评估:

1. 编程技能:

她掌握多种编程语言,包括MATLAB、C、C++、Python,这些都是算法开发中常用的语言。
熟练使用多个开发平台,如MATLAB、Visual Studio、Eclipse、Qt、CCS、Pycharm,这表明她具备跨平台开发的能力。
熟悉OpenCV、yolov 5等图像处理库,这些是计算机视觉领域的重要工具。

2. 专业知识:

她掌握了多种信号处理方法,如快速傅里叶变换、短时傅里叶变换、数字滤波器设计等,这些都是信号处理和图像处理领域的基础。
熟悉深度学习框架,如tensorflow、keras、Pytorch,这些是当前人工智能和机器学习领域的主流工具。

3. 工作经验:

// ...

我们需要一位NLP工程师,专注能大模型的应用,她能够胜任? 根据李秀宁的简历,她在图像处理和信号处理方面有丰富的经验和专业知识,但在自然语言处理(NLP)和大模型应用方面的经验并不明显。简历中没有提到她有直接从事NLP项目或使用大模型(如BERT、GPT等)的经验。 NLP工程师通常需要具备以下技能和经验: 1.