Scaling Laws for Mixture Pretraining Under Data Constraints
随着语言模型的扩展,它们所需的数据量也在增长,但许多目标数据源(例如低资源语言或专业领域)本质上在大小上受到限制。一种常见的策略是将这种稀缺但有价值的目标数据与丰富的通用数据混合在一起,这提出了一个基本的权衡:混合物中的目标数据太少会使模型在目标域中暴露不足,而太多的目标数据会过度重复相同的示例,从而产生收益递减并最终导致过度拟合。我们在 2,000 多次语言模型训练中研究了这种权衡……
Why Don’t We Keep Buying? (And Buying)
1871 年,卡尔·门格尔给出了边际效用递减的最佳解释。 1871 年的情况在今天也同样如此。
Newly independent Honeywell Aerospace seeks organic growth, but won’t rule out M&A
该公司首席执行官表示,他认为资本配置分为四个优先级递减的层次:有机增长、无机增长、股息和股票回购。